三张卡的烦恼,怎么合理分配
-
最省心的分法,3 卡各司其职:
- 2×R9700(32G) 全给 Qwen:一张卡一个 27B 实例(一人一卡,延迟最稳),或用 --parallel 2 在一张卡上切 2 slot;32G 跑 Q6_K 22G + 128K KV 很从容。
- 7900XTX(24G) 专职 ComfyUI:生图 FLUX 24G 够,Wan 14B fp8 ~14-19G 也塞得下。它带宽最猛(960GB/s)但只有 24G,做多用户 LLM 撑不起长上下文,反而浪费。
关键原则:ComfyUI 和 LLM 别共卡——生图/生视频会把显存和算力吃满,Qwen 延迟会大幅抖动;分卡后互不干扰。
唯一要权衡的是:7900XTX 单跑 27B decode 其实是全场最快(960GB/s 带宽),但 24G 只够一个人用短上下文;你既然有多人需求,还是拿 32G 的 R9700 当 LLM 主力更稳,多用户长上下文不吃亏。