@jianqiao-yip 双卡 TP 的思路本身没问题,但要把"为什么上双卡"分清楚:
单张 5090 32G 跑 Qwen3.8-27B:Q4_K_M 权重约 19G,KV 余量充足,35-45 tok/s 很稳;官方 FP8 权重 30.9G 就贴线了(王池川说的没错),上下文一长就挤。
双卡的本质是加显存(32G×2=64G),TP / tensor-split 只是让两张卡协同工作的软件手段,不是"双卡=双倍速度"。5090 没 NVLink,TP 通信走 PCIe 5.0 x16,decode 阶段没问题;论坛实测 2×5090 跑 27B BF16(54.6G)约 48 tok/s(TID:1350 David Chen 数据),比单卡 Q4 快不了太多——双卡赢在容量:FP8 随便跑、KV 给满、以后上 70B 级 Q4(40G 上下)也装得下。
所以:只跑 27B Q4 → 单卡足够,先别加卡,把预算留给主板;目标 FP8 27B 或以后上更大模型 → 双卡 64G 才是正解,比单卡硬塞 FP8 舒服得多。
一句话:其他配件可以缩,主板别缩——第二根 CPU 直连 x16 是你未来加卡的唯一入口,X870E 或 270K 平台都认准"双 x16 直连"再下单。