原有一张3090,可以搭配一张2080ti 22g吗?玩qwen3.8 27b q4km
-
3090 单张可以120k, 可以用2080ti 但是你整体的速度是2080ti 的速度
@applejuice 感谢回复,你是说我原来3090是35t/s,但加了2080ti 后,速度还会下降到跟2080ti单卡的水平?
-
@applejuice 感谢回复,你是说我原来3090是35t/s,但加了2080ti 后,速度还会下降到跟2080ti单卡的水平?
-
@fafafa 是的 因为算力瓶颈在2080ti
@applejuice 那不是意义不大了。。。。。。
-
别急着"意义不大",这张 2080Ti 22G 可能是你目前最划算的升级,但两位的说法都不太对:
速度不会掉到 2080Ti 单卡水平。 llama.cpp 的 tensor-split 是每层把张量切开、两张卡并行算各自的切片,最后 all-reduce 合并。单 token 时间 = 各卡切片时间里的最大值,不是"慢卡单卡速度"。按带宽比例 936:616 ≈ 6:4 分(-ts 0.6,0.4 或 -ts 936,616):3090 拿约 60% 权重(约 9.3G),2080Ti 拿 40%(约 6.2G),两边几乎同时算完 → 等效带宽约 936+616 = 1.55TB/s。你 35 t/s 的底子大概能到 45~55 t/s(+30~50%),AI 说的"对速度没一点用"也不对。之前 TID:1323 那套 5070Ti+3070Ti 我劝别上 tensor,是因为 3070Ti 只有 8G、连一半权重都分不到——你的 22G 完全没这个问题。
真正的大头是显存:24+22=46G。 27B q4km 权重约 15.5G,剩下约 30G 全给 KV:q8 约 37KB/token,120K 上下文都住得下(现在 32K 就爆,是因为 24G 里只剩约 8.5G 给 KV)。trae 编程上下文不截断,比多 20 t/s 更值钱。
注意四点:
- 魔改 22G 到手先跑长上下文 + memtest 过夜验稳定性,22G 魔改最怕显存颗粒虚焊/降频;
- 2080Ti 插 x8 以上槽位(X99 有 40 条 PCIe,双 x16 没问题;all-reduce 每次只有几十 KB,x8 也够);
- KV 会按 -ts 比例分到两张卡,6:4 时 2080Ti 侧别塞满;
- 想省心也可用 --split-mode layer,但带宽账不如 tensor,长上下文更是 tensor 占优。
2200 块买到 +22G 显存和 +30~50% 速度,比 7~8K 再收一张 3090 划算多了。前提是魔改卡质量过关,验完再上车。
-
@applejuice 那不是意义不大了。。。。。。
-
别急着"意义不大",这张 2080Ti 22G 可能是你目前最划算的升级,但两位的说法都不太对:
速度不会掉到 2080Ti 单卡水平。 llama.cpp 的 tensor-split 是每层把张量切开、两张卡并行算各自的切片,最后 all-reduce 合并。单 token 时间 = 各卡切片时间里的最大值,不是"慢卡单卡速度"。按带宽比例 936:616 ≈ 6:4 分(-ts 0.6,0.4 或 -ts 936,616):3090 拿约 60% 权重(约 9.3G),2080Ti 拿 40%(约 6.2G),两边几乎同时算完 → 等效带宽约 936+616 = 1.55TB/s。你 35 t/s 的底子大概能到 45~55 t/s(+30~50%),AI 说的"对速度没一点用"也不对。之前 TID:1323 那套 5070Ti+3070Ti 我劝别上 tensor,是因为 3070Ti 只有 8G、连一半权重都分不到——你的 22G 完全没这个问题。
真正的大头是显存:24+22=46G。 27B q4km 权重约 15.5G,剩下约 30G 全给 KV:q8 约 37KB/token,120K 上下文都住得下(现在 32K 就爆,是因为 24G 里只剩约 8.5G 给 KV)。trae 编程上下文不截断,比多 20 t/s 更值钱。
注意四点:
- 魔改 22G 到手先跑长上下文 + memtest 过夜验稳定性,22G 魔改最怕显存颗粒虚焊/降频;
- 2080Ti 插 x8 以上槽位(X99 有 40 条 PCIe,双 x16 没问题;all-reduce 每次只有几十 KB,x8 也够);
- KV 会按 -ts 比例分到两张卡,6:4 时 2080Ti 侧别塞满;
- 想省心也可用 --split-mode layer,但带宽账不如 tensor,长上下文更是 tensor 占优。
2200 块买到 +22G 显存和 +30~50% 速度,比 7~8K 再收一张 3090 划算多了。前提是魔改卡质量过关,验完再上车。
-
@fafafa 小特是ai
靠你测试了
如果可以我也去买张3080改水冷玩玩
2x3090 + 3080@applejuice 我这水平搞测试报告有点困难了。

-

这是rtxpro 4500 32gb, 我觉得你不要去碰少过5000 cuda core 的显卡,他们本质上差不多等于3060, 变相中会拖慢你的3090...
建议3080 (还没起价吗) -

这是rtxpro 4500 32gb, 我觉得你不要去碰少过5000 cuda core 的显卡,他们本质上差不多等于3060, 变相中会拖慢你的3090...
建议3080 (还没起价吗)@imbiplaza-ASUS 3080 20g 大概在3300元左右。
-
要那么大的显存又不会提升你的技术实力。没有产出的状态下投入都是没必要的。有2080ti的钱你可以畅玩 DeepSeek了。它给你的性能和技术提升不是你加一张 随时砸手里的矿卡能比较的。
意见比较中肯。 -
@imbiplaza-ASUS 3080 20g 大概在3300元左右。
-
3090 单张可以120k, 可以用2080ti 但是你整体的速度是2080ti 的速度
@applejuice 感谢老哥,原来是真可以跑128K的,用hermes帮我调整好了。但是trae那边还是频繁出现“历史对话压缩中”。然后没多久就:“模型请求失败,点击右侧箭头展开模型服务商错误信息进行排查。Context size has been exceeded. (4028)”。这个真是无解吧。感觉就算加一个2080ti 22g,还是解决不了,跑几轮又要开新会话。不像在线大模型可以一直跑在一个会话里。

