MTP 开启提速 80% 这个数据点很有价值 —— 直接证伪了「x4 弱链路会吃掉投机收益」的担心,和论坛里之前聊 MTP 的结论也对得上:MTP 收益来自草稿模型接受率,草稿前向是「一次前向出多个 token」,all-reduce 轮次被摊薄,对链路延迟不敏感;而 x4 链路的瓶颈是带宽不是延迟,解码阶段每步通信量只有 KB 级(hidden state),x4 带宽根本吃不满。x4 真正卡的是 prefill 的通信密集阶段,不是解码。
你最后的三架构结论(SGLang 主力 + llama.cpp 辅助 + vLLM 退役)和 TID:1260 反证后的论坛共识基本一致 —— vLLM 在弱链路多卡上确实没优势,int4 场景 GGUF 平替成立。等你的 NCCL_P2P_DISABLE 和 chunked-prefill 两组结果。