@terry 单卡没差别
但是我觉得我们这种双卡跑大模型 平台还是越新越好
而且我发现内存 越快也越好
我一开始内存 插错槽
decode/prefill 性能比x99 更差
过后插对槽, decode/prefill 性能立刻提升20-30%
所以内存速度应该有分别
@johnnybegood 过分了 甚至主板那些也起价
@terry 单卡没差别
但是我觉得我们这种双卡跑大模型 平台还是越新越好
而且我发现内存 越快也越好
我一开始内存 插错槽
decode/prefill 性能比x99 更差
过后插对槽, decode/prefill 性能立刻提升20-30%
所以内存速度应该有分别
@johnnybegood 过分了 甚至主板那些也起价
现阶段 4080 32gb 价钱只高过3090 一点点
感觉比3090 划算多了
64gb
也不需要nvlink 就有2000prefill
如果玩 不试试 3090 x4 吗 
我只是小白 但是我想说
3090 x2 nvlink 应该只差在prefill
照理说 decode 不应该差那么多
之前我用nvlink decode 也没差很多
prefill 很明显
但是用p2p 照理说也速度也只是差100gb/s 跟 50gb/s的距离
又照理说不应该会差很多
可惜我都nvlink 用不到 不然可以测测
@starryskyknight 再来1m上下文 我就有借口 上4卡 3090 了
@imbiplaza-ASUS 穷到只剩gpu
@imbiplaza-ASUS 这种我接受不了 太丑
@imbiplaza-asus 全铜也不便宜
而且我这种涡轮3090也不适合
@johnnybegood 想把箱内温度压下来 现在动不动机箱都55+
@johnnybegood 既然改不上水冷吗?
@Eric-Su 开放式 机箱吗 ?
我也想玩 4张
虽然说现阶段不需要
@imbiplaza-ASUS 现在新加坡 马来西亚的2手 3090 都比淘宝便宜
想买2手来改水冷玩4张3090 但是难度太高 钱要花太多
@Mediali-Li 果然高手在民间
1500prefill 我都感觉很不错了
@Mediali-Li 如果你这个是稠密模型 那是真强
@Mediali-Li 什么模型可1800?
350w 算是没功耗限制 3090 最高功耗好像就是350w
平常都是245w限制
这个就是 245w限制
| 场景 | ON (t/s) | OFF (t/s) | Δ decode | tok/chunk ON | tok/chunk OFF |
|---|---|---|---|---|---|
| 代码生成 | 147.6 | 258.1 | +74.9% | 3.64 | 6.32 |
| 英文技术论述 | 109.2 | 147.2 | +34.8% | 2.69 | 3.63 |
| 中文常规对话 | 80.5 | 103.5 | +28.6% | 1.99 | 2.56 |
| 中文散文 | 67.0 | 64.3 | −4.0% | 1.67 | 1.60 |
对比350w 后面100w, 30%的功耗, 只换来10%+ 的性能
@neo 我都想玩4张3090,无奈那个难度是几倍起跳
散热 电源都是问题
@Don-zhu 我觉得差不多 一方面你没有nvlink 然后 pcie x8
@Don-zhu prefill 多少
楼主是nvlink pcie 也不重要了,因为都显卡数据交换 经过nvlink 不经过pcie
你的是x8 我的是x16 分别就是这里
单路 decode,rounds=3、max_tokens=512、temperature=0, NCCL_P2P_DISABLE=0, NCCL_P2P_LEVEL=SYS, disable_custom_all_reduce=true, 245w 功耗
| 场景 | ON (t/s) | OFF (t/s) | Δ decode | tok/chunk ON | tok/chunk OFF |
|---|---|---|---|---|---|
| 代码生成 | 147.6 | 258.1 | +74.9% | 3.64 | 6.32 |
| 英文技术论述 | 109.2 | 147.2 | +34.8% | 2.69 | 3.63 |
| 中文常规对话 | 80.5 | 103.5 | +28.6% | 1.99 | 2.56 |
| 中文散文 | 67.0 | 64.3 | −4.0% | 1.67 | 1.60 |
并发 2 路 aggregate decode(代码场景):
| 并发模式 | ON (t/s) | OFF (t/s) | Δ | OFF 相对单路 |
|---|---|---|---|---|
| 同 prompt(radix 命中) | 232.2 | 463.7 | +99.7% | ×1.80 |
| 不同 prompt | 221.1 | 433.2 | +95.9% | ×1.68 |
唯一随机 prompt(规避 radix 命中),max_tokens=1,rounds=2 取最快。
固定开销标定 411 ms(极短 prompt 最小 TTFT,5 次取 min)。
| 实际 prompt_tokens | TTFT (s) | 原始 t/s | 扣除开销 t/s |
|---|---|---|---|
| 2,160 | 1.529 | 1413 | 1933 ️ |
| 8,502 | 5.167 | 1645 | 1788 |
| 16,982 | 10.304 | 1648 | 1717 |
| 33,703 | 21.657 | 1556 | 1586 |
| 67,642 | 49.198 | 1375 | 1386 |
| 137,835 | 124.093 | 1111 | 1114 |
真没想到
才过3个月 显卡 从6000 冲上1万
想当初卖家卖我7200 我都觉得他坑我
@terry 我之前就是盲猜
所以交了学费