昨天看到一个博主的配置(5060ti 16G X4 )+华南H12D-8D 这能成吗?
-
主要 我有点不确定,满载的时候效果会不会太好,我这卡5月初刚到的时候是小心翼翼。 自从这几天我发现 它满载的时候效果可能更好,我就不锁定它的频率或者功耗了,反正是单卡,接口也没过热,直接当游戏卡一样,让它自动调节 。 @applejuice
-
话说h12d-8d pcie 16 的间距是正常的3 条pcie 距离吗
@applejuice 應該只能插 2slot 的吧。
-
我来插嘴一下,其实你们在讨论5060ti 还是3090.。。。我以我玩过多卡的经验来给意见:
第一条pcie 5.0 x 16 满载,第二条pcie 3.0 x 4 满载
qwen3.6 27b,
rtx3060 12g = 1 t/s (不足vram, 用ddr4 3200)
rtx3060 12g x 2 = 24g vram = 5 t/s (提升5倍,用第一张开跑compute, 不快,总算可以看到文字在跑动)
rtx3060 12g + rtx 5060ti 16gb = 28g vram = 20 t/s (提升4倍,16gb vram 先满载, rtx3060 12gb loading 一半vram, 主要rtx5060ti 在compute)
rtxpro 4500 32gb 单卡 = 60 t/s (提升3倍, 全部loading 进入vram, 51.2k, 消耗30gb 满载,compute 单卡满载)建议,你既然在国内,就应该优先选择魔改48g...要不然就选择单卡 32g 或以上。。。
最完美就是你等 blackwell 16g 魔改 32g (,rtx5070ti, 5080 16gb, 他们在做着) -
我来插嘴一下,其实你们在讨论5060ti 还是3090.。。。我以我玩过多卡的经验来给意见:
第一条pcie 5.0 x 16 满载,第二条pcie 3.0 x 4 满载
qwen3.6 27b,
rtx3060 12g = 1 t/s (不足vram, 用ddr4 3200)
rtx3060 12g x 2 = 24g vram = 5 t/s (提升5倍,用第一张开跑compute, 不快,总算可以看到文字在跑动)
rtx3060 12g + rtx 5060ti 16gb = 28g vram = 20 t/s (提升4倍,16gb vram 先满载, rtx3060 12gb loading 一半vram, 主要rtx5060ti 在compute)
rtxpro 4500 32gb 单卡 = 60 t/s (提升3倍, 全部loading 进入vram, 51.2k, 消耗30gb 满载,compute 单卡满载)建议,你既然在国内,就应该优先选择魔改48g...要不然就选择单卡 32g 或以上。。。
最完美就是你等 blackwell 16g 魔改 32g (,rtx5070ti, 5080 16gb, 他们在做着)3090 是被带歪了
主要是讨论 h12d-8d 带4张5060h12d-8d 是满载 pcie4 x16 4条
用4张5060在h12d-8d 是有 也只有 pcie4.0x8 的效果所以4 张 5060 理论也只有pcie4x8 的速度 15.75gb
但是也是terry 说的短板
5060 bandwith 448gb
所以4张 用 llama tp4
效率可能也提高不多
用layer split 应该就更慢了 被15.75gb拖累唯一的好处应该就是 低价钱 可以用上 27b 长上下文
效率 20-30t/s decode? 1000ts pp? 盲猜不看未来的架构
我还是觉得 3090x2 + nvlink 是性价比 最高 -
我来插嘴一下,其实你们在讨论5060ti 还是3090.。。。我以我玩过多卡的经验来给意见:
第一条pcie 5.0 x 16 满载,第二条pcie 3.0 x 4 满载
qwen3.6 27b,
rtx3060 12g = 1 t/s (不足vram, 用ddr4 3200)
rtx3060 12g x 2 = 24g vram = 5 t/s (提升5倍,用第一张开跑compute, 不快,总算可以看到文字在跑动)
rtx3060 12g + rtx 5060ti 16gb = 28g vram = 20 t/s (提升4倍,16gb vram 先满载, rtx3060 12gb loading 一半vram, 主要rtx5060ti 在compute)
rtxpro 4500 32gb 单卡 = 60 t/s (提升3倍, 全部loading 进入vram, 51.2k, 消耗30gb 满载,compute 单卡满载)建议,你既然在国内,就应该优先选择魔改48g...要不然就选择单卡 32g 或以上。。。
最完美就是你等 blackwell 16g 魔改 32g (,rtx5070ti, 5080 16gb, 他们在做着) -
3090 是被带歪了
主要是讨论 h12d-8d 带4张5060h12d-8d 是满载 pcie4 x16 4条
用4张5060在h12d-8d 是有 也只有 pcie4.0x8 的效果所以4 张 5060 理论也只有pcie4x8 的速度 15.75gb
但是也是terry 说的短板
5060 bandwith 448gb
所以4张 用 llama tp4
效率可能也提高不多
用layer split 应该就更慢了 被15.75gb拖累唯一的好处应该就是 低价钱 可以用上 27b 长上下文
效率 20-30t/s decode? 1000ts pp? 盲猜不看未来的架构
我还是觉得 3090x2 + nvlink 是性价比 最高 -
-
昨天他的测试成绩并不理想 27b fp8 prefill 2300 decode mtp3 100tks
-
昨天他的测试成绩并不理想 27b fp8 prefill 2300 decode mtp3 100tks
@Mediali-Li prefill 2300 还不错啊
-

-
@Mediali-Li prefill 2300 还不错啊
@applejuice 2080ti四卡 27b fp8 优化后也有 2200 prefill 输出大概是80tks-100tks
-
再发一个对比


