折腾了大半个月,我也是2* R9700的拥有者了!
-
@iamvirus 你是用哪个框架跑的?这个是我现在的结果。
model test t/s peak t/s ttfr (ms) est_ppt (ms) e2e_ttft (ms) qwen3.8-27b-vllm pp2048 5583.15 ± 28.47 462.25 ± 1.87 367.01 ± 1.87 462.25 ± 1.87 qwen3.8-27b-vllm tg512 89.31 ± 0.54 158.00 ± 8.00 qwen3.8-27b-vllm pp2048 @ d32768 4064.02 ± 6.25 8662.14 ± 12.93 8566.90 ± 12.93 8664.12 ± 12.93 qwen3.8-27b-vllm tg512 @ d32768 71.44 ± 4.38 98.50 ± 3.50 qwen3.8-27b-vllm pp2048 @ d131072 2834.51 ± 3.37 47059.94 ± 55.99 46964.70 ± 55.99 47068.55 ± 56.28 qwen3.8-27b-vllm tg512 @ d131072 81.19 ± 5.75 155.00 ± 7.00 qwen3.8-27b-vllm pp2048 @ d196608 2354.26 ± 0.23 84477.25 ± 8.47 84382.01 ± 8.47 84489.27 ± 8.19 qwen3.8-27b-vllm tg512 @ d196608 92.51 ± 1.40 116.00 ± 2.00 -
我现在双R9700 跑qwen3.8 27b 单卡限制240w 现在C1 decode 160-200tok/s C8能达到最高500tok/s
prefill现在16K 5000+tok/s 128k 4000+ tok/s
总的KVcache 有922k tokens
现在本地玩subagent速度贼快了 -
@iamvirus 我是小白,有能抄作业的地方吗?
我现在用的是这个:https://github.com/magiccodingman/vllm-radiance@nami-ryuu 不是这个 论坛里面就有,https://lcz.me/topic/1529/31 这个里面的

