双卡7900xtx VLLM qwen3.8 爽玩agent pp1600 tg 160+ (附 mtp/7900xtx全攻略)
-
什么电源啊 双卡7900xtx有6个8pin口 我振华电源1200瓦是 4个8pin口加一个600瓦的12pin的口
-
,
T terry 固定了此主题
-
什么电源啊 双卡7900xtx有6个8pin口 我振华电源1200瓦是 4个8pin口加一个600瓦的12pin的口
-
,L laobenxiong 引用了 此主题
-
r9700,rdna4能按这个跑么?
-
r9700,rdna4能按这个跑么?
-
r9700,rdna4能按这个跑么?
@gk20082000
我又来做好人了,这里有现成的作业不去抄?
https://hub.docker.com/r/capicua25x/vllm-rocm-rdna4 -
@flyer666

来2个罩子,防尘效果不错 -
@flyer666

来2个罩子,防尘效果不错 -
@farmer-node 我强迫症,我要拿掉这个罩子。

发图片的时候一定要回车,单独一样,不然帖子排版很好不好看。@terry 好的,麻烦排版了,谢谢老哥,下次注意
-
,系统 取消固定了此主题
-
@gk20082000
我又来做好人了,这里有现成的作业不去抄?
https://hub.docker.com/r/capicua25x/vllm-rocm-rdna4@gk20082000
我又来做好人了,这里有现成的作业不去抄?
https://hub.docker.com/r/capicua25x/vllm-rocm-rdna4太感谢了,这个镜像直接把我的4卡R9700带到起飞了,直接解决了困扰我好多天的问题。
-
,G gk20082000 引用了 此主题
-
能,带宽账先算清楚:楼主是华擎板 PCIe 4.0 ×8 拆分,单卡带宽 ≈ 4.0×8 = 16GB/s;X99 双 x16 是 PCIe 3.0 ×16,带宽同样是 16GB/s——两边同级,不存在总线瓶颈差距。
LLM 推理本来就不吃 PCIe:权重和 KV 全在显存里,总线只跑 prompt 和结果。tg(160+ 那个数)是纯 GPU 计算,跟总线带宽基本无关;prefill 略受影响,但短上下文几乎无感。
两个提醒:
- 确认 X99 的两条 x16 是 CPU 直连,且插双卡后不会降成 x8/x8(不少 X99 板第二槽是芯片组 x8 甚至 x4)。就算掉到 x4,decode 也照跑(论坛实测 x4 拖不动 MTP+80% 的性能),只是长上下文 prefill 慢点。
- 双卡 7900XTX 走 vLLM 就用楼主这个 JartX fork,stock vLLM 对 7900XTX 一堆数值溢出退化;RDNA 的 RCCL/TP 是坑(P2P 默认禁用),别指望标准 TP,按楼主的路线来。
CPU 方面 X99 老 E5 比楼主的 9600X 差一些,但 decode 是 GPU 瓶颈,影响不大;瓶颈在显存和 vLLM 配置,不在总线。
-
,F franklee006 引用了 此主题
-
,F flyer666 引用了 此主题

