3090+3080 20G+3080 10G,计划升级TRX40平台
-
目前配置是:
13600KF
GIGABYTE Z690 AORUS MASTER
16G2+24G2 频率5266
3090+3080 20g+3080 10gLm studio Qwen 3.6 27b Q6_k, Hermes Agent 128K上下文.
发现两张3080跑在3.0X4速度上,prompt processing 特别慢,token速度也是17/18 tk/s,
为了摆脱瓶颈,计划升到撕裂者
3960X
华硕 STRIX TRX40-E GAMING
16G4 ECC UDIMM DDR4 要不要16G6加到96G?
显卡要不要把3080 10g 也换成3080 20g?这样我的电源1300W 不够了,手上还有个550W的 SFX电源,打算塞进去机箱,双电源,辅助电源单独供应3090,其余由主电源供应。
请帮我看看这样是否合适,还是说我可以用X99平台,更省钱?我是想维持三卡系统
-
三卡64G和双卡48G,数字上确实三卡多,但对跑LLM来说显存不是简单相加的,关键看模型能不能真正切到多张卡上并行。
先说你最关心的那个问题:三卡64G vs 双卡48G。LLM多卡并行靠的是张量并行(tensor parallel),模型按层切到各卡,每张卡只存一部分。理论上三卡能装更大的模型,但有两个硬约束:
- 最慢的那张卡决定整体速度。你现在的组合是3090 24G + 3080 20G + 3080 10G,10G那张卡装不下几层大模型的权重,并行时整条链路都被它拖住。
- 卡间通信是另一个瓶颈。你发现两张3080跑在3.0 x4上、prompt processing特别慢,这就是卡间带宽不够的典型症状。TRX40能解决PCIe通道数问题(3960X有64条PCIe 4.0),但跨卡通信走的还是PCIe总线,不是NVLink,带宽天花板依然在那里。
所以terry说的"都出了买两个3090"其实是有道理的,我再补充一点数据:
- 双3090用NVLink桥接(约112GB/s双向带宽),跨卡通信比PCIe 4.0 x16(约32GB/s)快3倍以上,这才是"多卡接近单卡"的正确姿势
- 48G双卡跑Qwen 3.6 27B Q6_K(约22GB)+ 128K上下文 + Hermes Agent完全够用,还能余出显存跑更大模型
- 三卡64G的代价:异构显存(24+20+10)让切分非常难受,10G卡基本是拖后腿的;如果你坚持三卡,至少要把10G那张换成20G
关于电源:不建议双电源方案。1300W带3090+两张3080确实紧张,但SFX 550W单独供电3090的时序和共地问题很容易出怪毛病,折腾成本高。更稳妥的做法是直接换一个1600W的ATX3.0/3.1电源,或者接受terry的建议精简到双卡。
平台选择:如果你维持三卡,TRX40是对的(PCIe 4.0 x16 x16 x16,三卡都能跑满通道);如果走双3090 NVLink路线,Z690其实够用,NVLink桥不吃PCIe通道。预算紧张的话,X99平台(PCIe 3.0)跑三卡会复现你现在3.0 x4的带宽困境,不建议。
我的建议:如果你主要跑27B这个量级,双3090 + NVLink是最优解,省心、快、显存够;如果你确实想上70B级别的模型(Q4大概40G),那三卡64G才有意义,但必须把10G换掉、上TRX40、换大电源,成本比双3090高不少,得自己权衡。
-
如果跟一家买 3090 + nvlink
你们国内应该方便
有问题立刻退
我的3090是三风扇卡, 研究了一下我若卖掉3080换3090组Nvlink,需要4槽的才行,好像淘宝都没有卖的了。
而且查了不少博主的数据显示,在3090这样的卡,跑CPU直连的Pcie4.0*16通道,只比Nvlink大概损失10%的速度。因此我决定还是改成3960X TRX40主板,3090+双3080 20G,让两张3080加载Qwen, 让3090加载comfy UI的模型。
我最在乎prefill阶段的速度应该可以通过更换平台得到很大提升,生成阶段速度应该是在20tk/s左右,是能接受范围。到时候实测看看。
-
多卡的意义到底是什么?
又不能1+1=2 纯为了折腾吗? -