3张7900xtx能跑 sglang吗 3960X撕裂者+tr40主板 3个*16
-
TP 只可以 2 / 4
-
TP 只可以 2 / 4
@franklee006
好的,老哥 谢谢; 这个U主板有 3~4个PCIE 4.016的, 插3个是 3个16pcie 插4个是 16 8 16 8 -
@franklee006
好的,老哥 谢谢; 这个U主板有 3~4个PCIE 4.016的, 插3个是 3个16pcie 插4个是 16 8 16 8TP=3 能不能跑,先看模型,不是看卡数。SGLang 的 --tp-size 允许 3,但 attention 的 num_attention_heads / num_key_value_heads 必须能被 3 整除,否则每卡分到的头数不均、还要 padding,通信仍按 3 路 ring 走。27B/30B 这类常见 40 头、64 头(2/4/8 友好),除不尽 3——所以楼上说「只可以 2 / 4」不是硬限制,是难找到陪你按 3 分的模型。真要 TP=3,先查目标模型的 head 配置。
3 张更划算的两种用法:
- TP=2 跑能塞进 2×24G 的模型,第 3 张单独挂另一个模型/embedding/rerank;
- 上能整除 3 的 MoE(看专家数与 EP 配置),或补第 4 张走 TP=4。
7900XTX 是 gfx1100(RDNA3),没有 NVLink;消费级 AMD 的 PCIe P2P 常年不可用(hipDeviceCanAccessPeer 多为 NO),RCCL 会退回 host-staged,rank 间 all-reduce 走系统内存。batch=1 decode 时通信暴露高,TP 收益容易被吃掉。用 SGLang 的 pp/tg 分开测,单卡 vs TP=2/3 对比再定。
平台侧:3960X 有 64 条 PCIe4.0 lane,3 槽 x16 物理够;但 ASUS PRIME TRX40-PRO S 的槽位分配要查手册(常见 x16/x8/x16,第三槽可能走芯片组或与 M.2 抢通道)。用 lspci -vv 看三卡的 LnkSta 是否都到 4.0 x8 以上。
内存 64G:SGLang 每卡一个 worker,加载权重与 HIP context 各占一份 host 内存,3 卡建议 128G 起,要 CPU offload 更不够。
供电:3×7900XTX 各约 350W(瞬态更高)加 CPU 约 280W,双 1600W 分路(一路 CPU/主板、一路 GPU)够;每卡 3×8pin 走独立线,别一线带两卡。
结论:能起,但 TP=3 通常不划算;先定模型和它的头数,再决定 2 还是 4。
-
这种常识性问题直接问一个 免费 在线 AI就行。
7900xtx 只支持双卡。