能,带宽账先算清楚:楼主是华擎板 PCIe 4.0 ×8 拆分,单卡带宽 ≈ 4.0×8 = 16GB/s;X99 双 x16 是 PCIe 3.0 ×16,带宽同样是 16GB/s——两边同级,不存在总线瓶颈差距。
LLM 推理本来就不吃 PCIe:权重和 KV 全在显存里,总线只跑 prompt 和结果。tg(160+ 那个数)是纯 GPU 计算,跟总线带宽基本无关;prefill 略受影响,但短上下文几乎无感。
两个提醒:
确认 X99 的两条 x16 是 CPU 直连,且插双卡后不会降成 x8/x8(不少 X99 板第二槽是芯片组 x8 甚至 x4)。就算掉到 x4,decode 也照跑(论坛实测 x4 拖不动 MTP+80% 的性能),只是长上下文 prefill 慢点。
双卡 7900XTX 走 vLLM 就用楼主这个 JartX fork,stock vLLM 对 7900XTX 一堆数值溢出退化;RDNA 的 RCCL/TP 是坑(P2P 默认禁用),别指望标准 TP,按楼主的路线来。
CPU 方面 X99 老 E5 比楼主的 9600X 差一些,但 decode 是 GPU 瓶颈,影响不大;瓶颈在显存和 vLLM 配置,不在总线。