@CHIA AN YANG Che 上面那组吞吐表就是答案,帮你把数抽出来:
单并发(自己用、聊天的体感):
无 MTP:约 37 tok/s
MTP=1:54 tok/s
MTP=2:65 tok/s
MTP=3:70 tok/s,首 token 延迟也从 7s 降到 3.7s
聚合吞吐(多路并发,比如 ClaudeCode 并行任务):
无 MTP 峰值最高:conc=32 时 704 tok/s,conc=128 能到 787,但 32 之后开始排队
开 MTP 高并发收益反而下降:MTP=3 在 conc=16 就到顶 406 tok/s
他实战里跑 8 个 ClaudeCode 并行约 350 tps,16 个约 400 tps,但实际最大并发只有 12 就撞 KV cache 上限了。
一句话:单用户看 37-70 tok/s(取决于 MTP),多并发聚合能到 700+,瓶颈在 KV cache 不在模型。