双卡7900xtx VLLM qwen3.8 爽玩agent pp1600 tg 160+ (附 mtp/7900xtx全攻略)
-
这个周末在家用dsh疯狂pua白嫖来的美国豆包(gemini3.7-flash),用stock vllm 神奇的拉起来了 (Qwen3.8-27B-W4A16-AutoRound-GPTQ)[https://huggingface.co/Vishva007/Qwen3.8-27B-W4A16-AutoRound-GPTQ] 后 pp 1200 tg 50 无mtp后始终不太满意,继续调优,不得不说amd整vllm真是坑,尤其是7900xtx这种连fp8/AITER支持都没有的老架构,各种奇怪的数值溢出退化层出不穷,但好在最终全部搞定。顺便感谢论坛里的大神@iamvirus 的介绍https://github.com/JartX/vllm ,帮我把pp直接暴拉到几乎翻倍。
最后说下体验吧,vllm下开8路并发,llama.cpp下tensor parallel 和Hermes agent对话便秘的感觉(900pp 50tg)完全没了,两个agent同时可以30-40 tg跑毫无压力,三个对话也可以勉强运行,单流70-80tok/s和很多在线api差不多,唯一的问题就是qwen3.8 thinking又臭又长,和在线api实际体验还是慢不少。考虑到这两张卡入的时候加起来不到1万,能跑到现在这个水平很满意了。
我的机器是大体配置是一块终端华擎主板+32g ddr5+amd 9600x,可以做pcie4*8拆分给两张卡
先秀一下具体数值吧,首先短上下文dflash2是绝对的王者,吞吐和单流都比mtp2高至少30%:(只测到8个并发,更高没测过,因为对我来说没啥实用价值),以下是0上下文测出的数据:
并发路数 (Concurrency) DFlash2 聚合吞吐 (Aggregate TG) DFlash2 单路速率 (Per-Req TG) MTP3 聚合吞吐 (Aggregate TG) MTP3 单路速率 (Per-Req TG) 平均首字延迟 (TTFT) c = 1 113.25 tok/s 112.36 tok/s 111.41 tok/s 110.54 tok/s 178 ms c = 2 152.25 tok/s 77.49 tok/s 175.35 tok/s 88.94 tok/s 245 ms c = 3 177.60 tok/s 71.17 tok/s 204.84 tok/s 70.14 tok/s 350 ms c = 4 190.95 tok/s 56.45 tok/s 228.10 tok/s 67.44 tok/s 419 ms c = 5 211.76 tok/s 52.13 tok/s 254.79 tok/s 52.41 tok/s 490 ms c = 6 218.84 tok/s 44.23 tok/s 300.53 tok/s 51.73 tok/s 596 ms c = 7 249.90 tok/s 39.18 tok/s 289.66 tok/s 44.11 tok/s 703 ms c = 8 379.85 tok/s 🏆 50.18 tok/s 339.59 tok/s 43.74 tok/s 770 ms下面祭出dflash2论文中的最优workload(解数学题),可以看到150tok/s,实测有的题能到180tok/s,懒得找了

长上下文8k+ mtp和dflash就逐渐打平,但是mtp发挥往往比较稳定(tg随上下文稳定下降),dflash经常一会50 一会80随生成内容而跳,一般来说在80k上下,单流基本能在50-70之间,160k以上会一起退化到30. 以下是我用一个真实的dsh的session 文件 (80k context)一步步重放测出来的数值:

考虑到dflash占用了宝贵的显存,目前稳定跑还是切回了mtp,实测慢不了多少,kv的提升是实实在在的。

下面直接上教程,我把vllm简单fork一下把改动放进了一个单独的branch:https://github.com/StevenChenSE/vllm/tree/feat/dflash-perf-opt 找个能扛事的在线llm api和称手的harness让他照着这个README.md来搞,注意目前我这个是裸机跑的,所以你得让手动编译一下kernel,但也不是太复杂,就找harness自己搞就行。
-
陌拜大神,大神威武
-
不错。很有价值。上个主机的帅照就更完美了。
-
双卡应该 背靠背 更合理。
-
那就这样。你没机箱封闭。这样也没问题。
-
楼主参数是什么呢? 用的是和之前一样的模型和参数吗?
-
楼主参数是什么呢? 用的是和之前一样的模型和参数吗?
@farmer-node
看我repo啊,只能用我这个branch 跑起来,修了一堆bug和优化https://github.com/StevenChenSE/vllm/tree/feat/dflash-perf-opt
-
@farmer-node
看我repo啊,只能用我这个branch 跑起来,修了一堆bug和优化https://github.com/StevenChenSE/vllm/tree/feat/dflash-perf-opt
@flyer666 看到了,谢啦
-
什么电源啊 双卡7900xtx有6个8pin口 我振华电源1200瓦是 4个8pin口加一个600瓦的12pin的口
-
,
T terry 固定了此主题
-
什么电源啊 双卡7900xtx有6个8pin口 我振华电源1200瓦是 4个8pin口加一个600瓦的12pin的口
-
,L laobenxiong 引用了 此主题
-
r9700,rdna4能按这个跑么?

