昨天看到一个博主的配置(5060ti 16G X4 )+华南H12D-8D 这能成吗?
-
3090 是被带歪了
主要是讨论 h12d-8d 带4张5060h12d-8d 是满载 pcie4 x16 4条
用4张5060在h12d-8d 是有 也只有 pcie4.0x8 的效果所以4 张 5060 理论也只有pcie4x8 的速度 15.75gb
但是也是terry 说的短板
5060 bandwith 448gb
所以4张 用 llama tp4
效率可能也提高不多
用layer split 应该就更慢了 被15.75gb拖累唯一的好处应该就是 低价钱 可以用上 27b 长上下文
效率 20-30t/s decode? 1000ts pp? 盲猜不看未来的架构
我还是觉得 3090x2 + nvlink 是性价比 最高 -
-
昨天他的测试成绩并不理想 27b fp8 prefill 2300 decode mtp3 100tks
-
昨天他的测试成绩并不理想 27b fp8 prefill 2300 decode mtp3 100tks
@Mediali-Li prefill 2300 还不错啊
-

-
@Mediali-Li prefill 2300 还不错啊
@applejuice 2080ti四卡 27b fp8 优化后也有 2200 prefill 输出大概是80tks-100tks
-
再发一个对比

-
楼主的这个测试,跟我现有硬件配置差不多,我是用超微7048Gr服务器,cpu2673v4 20核40线程共2个cpu,三星内存2400t的32G2共64G,ubuntu22.04系统,显卡是rtx5000 16G显存3共48G+rtx A4000 16G显存1张,共计16*4=64G,目前运行llama.cpp,大模型用的Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-Q4_K_M这个,速度比Qwen3.6-27B-Uncensored-HauhauCS-Aggressive-MTP-Q4_K_P速度快的不是一点半点。具体测试参数我一会发,因为我是菜鸟,显卡都是朋友给的,不是太懂,自己买了个二手服务器,没用nvlink,在论坛看到很多朋友说安装nvlink调试很麻烦,就没有上。
-
手里的旧货可以折腾。花钱上就没什么意义了。如果手里有4张我也是建议折腾变现是最优解。
