昨天看到一个博主的配置(5060ti 16G X4 )+华南H12D-8D 这能成吗?
-
主要 我有点不确定,满载的时候效果会不会太好,我这卡5月初刚到的时候是小心翼翼。 自从这几天我发现 它满载的时候效果可能更好,我就不锁定它的频率或者功耗了,反正是单卡,接口也没过热,直接当游戏卡一样,让它自动调节 。 @applejuice
-
话说h12d-8d pcie 16 的间距是正常的3 条pcie 距离吗
@applejuice 應該只能插 2slot 的吧。
-
我来插嘴一下,其实你们在讨论5060ti 还是3090.。。。我以我玩过多卡的经验来给意见:
第一条pcie 5.0 x 16 满载,第二条pcie 3.0 x 4 满载
qwen3.6 27b,
rtx3060 12g = 1 t/s (不足vram, 用ddr4 3200)
rtx3060 12g x 2 = 24g vram = 5 t/s (提升5倍,用第一张开跑compute, 不快,总算可以看到文字在跑动)
rtx3060 12g + rtx 5060ti 16gb = 28g vram = 20 t/s (提升4倍,16gb vram 先满载, rtx3060 12gb loading 一半vram, 主要rtx5060ti 在compute)
rtxpro 4500 32gb 单卡 = 60 t/s (提升3倍, 全部loading 进入vram, 51.2k, 消耗30gb 满载,compute 单卡满载)建议,你既然在国内,就应该优先选择魔改48g...要不然就选择单卡 32g 或以上。。。
最完美就是你等 blackwell 16g 魔改 32g (,rtx5070ti, 5080 16gb, 他们在做着) -
我来插嘴一下,其实你们在讨论5060ti 还是3090.。。。我以我玩过多卡的经验来给意见:
第一条pcie 5.0 x 16 满载,第二条pcie 3.0 x 4 满载
qwen3.6 27b,
rtx3060 12g = 1 t/s (不足vram, 用ddr4 3200)
rtx3060 12g x 2 = 24g vram = 5 t/s (提升5倍,用第一张开跑compute, 不快,总算可以看到文字在跑动)
rtx3060 12g + rtx 5060ti 16gb = 28g vram = 20 t/s (提升4倍,16gb vram 先满载, rtx3060 12gb loading 一半vram, 主要rtx5060ti 在compute)
rtxpro 4500 32gb 单卡 = 60 t/s (提升3倍, 全部loading 进入vram, 51.2k, 消耗30gb 满载,compute 单卡满载)建议,你既然在国内,就应该优先选择魔改48g...要不然就选择单卡 32g 或以上。。。
最完美就是你等 blackwell 16g 魔改 32g (,rtx5070ti, 5080 16gb, 他们在做着)3090 是被带歪了
主要是讨论 h12d-8d 带4张5060h12d-8d 是满载 pcie4 x16 4条
用4张5060在h12d-8d 是有 也只有 pcie4.0x8 的效果所以4 张 5060 理论也只有pcie4x8 的速度 15.75gb
但是也是terry 说的短板
5060 bandwith 448gb
所以4张 用 llama tp4
效率可能也提高不多
用layer split 应该就更慢了 被15.75gb拖累唯一的好处应该就是 低价钱 可以用上 27b 长上下文
效率 20-30t/s decode? 1000ts pp? 盲猜不看未来的架构
我还是觉得 3090x2 + nvlink 是性价比 最高 -
我来插嘴一下,其实你们在讨论5060ti 还是3090.。。。我以我玩过多卡的经验来给意见:
第一条pcie 5.0 x 16 满载,第二条pcie 3.0 x 4 满载
qwen3.6 27b,
rtx3060 12g = 1 t/s (不足vram, 用ddr4 3200)
rtx3060 12g x 2 = 24g vram = 5 t/s (提升5倍,用第一张开跑compute, 不快,总算可以看到文字在跑动)
rtx3060 12g + rtx 5060ti 16gb = 28g vram = 20 t/s (提升4倍,16gb vram 先满载, rtx3060 12gb loading 一半vram, 主要rtx5060ti 在compute)
rtxpro 4500 32gb 单卡 = 60 t/s (提升3倍, 全部loading 进入vram, 51.2k, 消耗30gb 满载,compute 单卡满载)建议,你既然在国内,就应该优先选择魔改48g...要不然就选择单卡 32g 或以上。。。
最完美就是你等 blackwell 16g 魔改 32g (,rtx5070ti, 5080 16gb, 他们在做着) -
3090 是被带歪了
主要是讨论 h12d-8d 带4张5060h12d-8d 是满载 pcie4 x16 4条
用4张5060在h12d-8d 是有 也只有 pcie4.0x8 的效果所以4 张 5060 理论也只有pcie4x8 的速度 15.75gb
但是也是terry 说的短板
5060 bandwith 448gb
所以4张 用 llama tp4
效率可能也提高不多
用layer split 应该就更慢了 被15.75gb拖累唯一的好处应该就是 低价钱 可以用上 27b 长上下文
效率 20-30t/s decode? 1000ts pp? 盲猜不看未来的架构
我还是觉得 3090x2 + nvlink 是性价比 最高 -
-
昨天他的测试成绩并不理想 27b fp8 prefill 2300 decode mtp3 100tks
-
昨天他的测试成绩并不理想 27b fp8 prefill 2300 decode mtp3 100tks
@Mediali-Li prefill 2300 还不错啊
-

-
@Mediali-Li prefill 2300 还不错啊
@applejuice 2080ti四卡 27b fp8 优化后也有 2200 prefill 输出大概是80tks-100tks
-
再发一个对比

-
楼主的这个测试,跟我现有硬件配置差不多,我是用超微7048Gr服务器,cpu2673v4 20核40线程共2个cpu,三星内存2400t的32G2共64G,ubuntu22.04系统,显卡是rtx5000 16G显存3共48G+rtx A4000 16G显存1张,共计16*4=64G,目前运行llama.cpp,大模型用的Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-Q4_K_M这个,速度比Qwen3.6-27B-Uncensored-HauhauCS-Aggressive-MTP-Q4_K_P速度快的不是一点半点。具体测试参数我一会发,因为我是菜鸟,显卡都是朋友给的,不是太懂,自己买了个二手服务器,没用nvlink,在论坛看到很多朋友说安装nvlink调试很麻烦,就没有上。
-
手里的旧货可以折腾。花钱上就没什么意义了。如果手里有4张我也是建议折腾变现是最优解。

