llama-benchy RTX3090x2 PCiX-SLi 跑 pp2048=1267 t/s, tg32=109 token/s
-
使用 Llama-Benchy 对 vLLM tp 2 进行测试. MTP , ctx 128k:



没想到 Qwen3.6 27B Int4 能达到这样的运行速度。还没买 NvLink , 用PCIx 3.0x8
vLLM 主要参数
--max-model-len 131072
--tensor-parallel-size 2
--kv-cache-dtype fp8_e5m2
--max-num-batched-tokens 4128
--speculative-config '{"method":"mtp","num_speculative_tokens":3}'大家都用什么Bench测试?
-
使用 Llama-Benchy 对 vLLM tp 2 进行测试. MTP , ctx 128k:



没想到 Qwen3.6 27B Int4 能达到这样的运行速度。还没买 NvLink , 用PCIx 3.0x8
vLLM 主要参数
--max-model-len 131072
--tensor-parallel-size 2
--kv-cache-dtype fp8_e5m2
--max-num-batched-tokens 4128
--speculative-config '{"method":"mtp","num_speculative_tokens":3}'大家都用什么Bench测试?