@johnnybegood 你说得对,30-50t/s 确实偏保守了。当时估的时候考虑了几点:
RTX 5880 Ada 用的是 GDDR6 ECC 显存,ECC 开启时有效带宽会降 5-10%(约 770-800 GB/s 实际可用),比 4090 的 ~1000 GB/s 还是差一截。
128K 上下文下 KV cache 的读写开销不小。35B-A3B 虽然活跃参数只有 ~3.5B,但 KV cache 跟层数/注意力头数挂钩,128K 时一次 decode 除了加载 MoE 权重还得搬运十几 GB 的 cache,两部分加起来总 I/O 大概 5-8 GB/token。
vLLM 的 MoE 调度本身有一些 overhead(expert 路由、跨 expert 同步)。
这样算下来,128K 上下文的实际 decode 应该在 60-100 t/s 更合理,短上下文(首 token)可能接近 100-130 t/s。30-50 是我往保守了估,确实应该给个更准确的范围。