2x3090 NVLink 王者配置再度进化——SGLang dev507 + DFLASH2 全面复测,并发 249 t/s 新高峰
-
@Don-zhu 我觉得差不多 一方面你没有nvlink 然后 pcie x8
@applejuice 感谢回复。我也觉得是这个问题。
-
@Don-zhu prefill 多少
楼主是nvlink pcie 也不重要了,因为都显卡数据交换 经过nvlink 不经过pcie
你的是x8 我的是x16 分别就是这里
单路 decode,rounds=3、max_tokens=512、temperature=0, NCCL_P2P_DISABLE=0, NCCL_P2P_LEVEL=SYS, disable_custom_all_reduce=true, 245w 功耗
场景 ON (t/s) OFF (t/s) Δ decode tok/chunk ON tok/chunk OFF 代码生成 147.6 258.1 +74.9% 3.64 6.32 英文技术论述 109.2 147.2 +34.8% 2.69 3.63 中文常规对话 80.5 103.5 +28.6% 1.99 2.56 中文散文 67.0 64.3 −4.0% 1.67 1.60 并发 2 路 aggregate decode(代码场景):
并发模式 ON (t/s) OFF (t/s) Δ OFF 相对单路 同 prompt(radix 命中) 232.2 463.7 +99.7% ×1.80 不同 prompt 221.1 433.2 +95.9% ×1.68 Prefill
唯一随机 prompt(规避 radix 命中),
max_tokens=1,rounds=2 取最快。
固定开销标定 411 ms(极短 prompt 最小 TTFT,5 次取 min)。实际 prompt_tokens TTFT (s) 原始 t/s 扣除开销 t/s 2,160 1.529 1413 1933
️8,502 5.167 1645 1788 16,982 10.304 1648 1717 33,703 21.657 1556 1586 67,642 49.198 1375 1386 137,835 124.093 1111 1114 @applejuice 350W 这组 prefill 档位数据收了,19k 181k 从 1966 掉到1141 t/s(-42%)、TTFT9.8s 159s,退化曲线 很有用。
不过有个反直觉点想对齐:350W 墙下代码 284.9 反而比无
墙 246.7高 15%,散文 72.7 也高 18%,英文/中文却掉 10-21%——不像功耗墙特征,更像 prompt 或热身后的状态差 (tok/chunk 也不一样:6.69 vs 6.32)。方便的话同 prompt 无墙再跑一轮对照?真复现了就是功耗墙时钟策略对某些负 载有利,那是个大发现。
-
@starryskyknight 同配置复测来了,先报数据再请教硬件。
环境:SGLang 0.5.19 + twolven AWQ-MTP + incoai DFlash2(8/8, fp8_e5m2, mem 0.88, mamba 20, TP2, NCCL_P2P_DISABLE=1),你的统一脚本,t=0 / 512 tok / 3 rounds,thinking OFF:
单路 decode:代码 218.0 t/s(LRU prompt)、TTFT 0.06-0.10s
并发 2 路:同 prompt 355.2、不同 prompt 367.1想对齐几个硬件问题:
- 我这边 2×3090 走主板 PCIe x8+x8(i7-13700K,Z690),无 NVLink,NCCL P2P 已禁用。你那边 3090 是 x16 还是 x8?NVLink 之外主板的 PCIe 分配是?
- CPU 是什么?我在猜并发 355 vs 你 440 的差距主要来自 CPU/PCIe lanes(我是 24 线程桌面平台),不是模型或 SGLang 参数——想验证这个假设。
- mem-fraction 你用 0.90,我试过 0.88(给 draft graph 多点空间)单路略好,0.93 会挤 draft graph。你 0.90 时 draft graph avail mem 大概多少?
applejuice 兄的 EPYC 7452 数据(无 NVLink)我这边基本复现了(单路 218 vs 他 246,约 9% 差),所以怀疑剩的差距是纯平台带宽/核数。
@Don-zhu 收到,三个问题逐一回:
PCIe:我这边也是 x8+x8——Z890 平台 CPU 直出 20 lanes,x16 槽拆 x8/x8(PCIe 5.0),两卡各 x8,跟你一样。唯一物理差异就是 NVLink 桥。
CPU:Core Ultra 9 285K(24 线程)——巧了,跟你 13700K 线程数一样,所以并发差距不在 CPU 线程数。先说个口径:我 OFF 同 prompt 是 518.4 / 不同 550.8(不是 440)。真正的差距在你的 NCCL_P2P_DISABLE=1:TP=2 每步同步激活,你禁 P2P 后同步走 host 内存中转,并发多路时同步次数放大,差距就显形了。证据是模式:单路 218 vs 270(-19%),并发 -31%~-33%,差距随并发放大正是同步带宽特征。验证方法:打 smcleod/nvidia-p2p-patch 开 P2P(无 NVLink 的 3090 跨卡 P2P 默认被驱动锁,patch 后走 PCIe 4.0 x8 双向 ~16GB/s,远好于 host 中转),重跑并发——差距缩到 ~20% 以内就证伪 CPU 假设了。
mem-fraction 0.90:0.94 时日志打 Disable DFLASH draft cuda graph because only 0.93 GB GPU memory is available——graph 被挤掉;0.90 恢复启用(selector decode 也折叠进去)。精确 avail 我没记,估算 0.90 时 ~1.9GB 上下,看你自己启动日志这行的数字最准。你 0.88 单路略好我信,但会压缩 KV cache 上限,长 context 档位先吃紧,看用途取舍。
-
@stormaround
关于「DFLASH 牺牲视觉」:不会,正好今天实测验证了。DFLASH 只参与 decode 阶段(草稿出 token),图像编码在 prefill 阶段完成,两段正交。twolven 这个 AWQ 版视觉塔保留 bf16 未量化,模型卡原文就有 "vision still works"。今天 curl 直传图片实测:读图 100% 正确(形状/颜色/文字全对),同时段 DFLASH accept rate 0.28-0.40 照常跑,零冲突。真实照片测试连法文成分表都能正确 OCR。那还可以,之前用双r9700跑tp2,mtp和dflash速度差不多,就没有再去调dflash
@stormaround 有用就行。双 R9700 上 MTP/DFLASH 增益相近这个数据很宝贵,AMD 平台的 DFLASH 适配确实起步晚。这版 SGLang dev 对 DFLASH 动了不少(f60bc73c 修 TP 状态分歧 + draft cuda graph 默认启用),ROCm 下值得再试一轮。
-
还真就是王者了。NV显卡价格继续飙升。3090算是守门员了。
@williamlouis 主要是带宽管饱,两张 3090 够 27B 吃满, NVLink 把同步税砍掉后确实到头了。
-
@applejuice 350W 这组 prefill 档位数据收了,19k 181k 从 1966 掉到1141 t/s(-42%)、TTFT9.8s 159s,退化曲线 很有用。
不过有个反直觉点想对齐:350W 墙下代码 284.9 反而比无
墙 246.7高 15%,散文 72.7 也高 18%,英文/中文却掉 10-21%——不像功耗墙特征,更像 prompt 或热身后的状态差 (tok/chunk 也不一样:6.69 vs 6.32)。方便的话同 prompt 无墙再跑一轮对照?真复现了就是功耗墙时钟策略对某些负 载有利,那是个大发现。
350w 算是没功耗限制 3090 最高功耗好像就是350w
平常都是245w限制这个就是 245w限制
场景 ON (t/s) OFF (t/s) Δ decode tok/chunk ON tok/chunk OFF 代码生成 147.6 258.1 +74.9% 3.64 6.32 英文技术论述 109.2 147.2 +34.8% 2.69 3.63 中文常规对话 80.5 103.5 +28.6% 1.99 2.56 中文散文 67.0 64.3 −4.0% 1.67 1.60 对比350w 后面100w, 30%的功耗, 只换来10%+ 的性能
-
其實都是一樣,市售版(3slot) 3090 x 4 的飄過,雖然當初是想裝兩台做互相備援...
偉大的祖國怎麼沒人硬改 NVLINK 軟排長線...
剛看板主的窮人越窮有感而發... -
@Eric-Su 开放式 机箱吗 ?
我也想玩 4张
虽然说现阶段不需要@applejuice 沒,生產裝兩台(3945wx+WRX80E+128G DDR4)
的確有考慮買礦機架來裝,把手上5090/5070Ti都裝上去看看會怎樣
到時候再貼上來供大家娛樂
PS. EVGA(大哥) 3090 預設功耗可以到450W -
@neo 也太厉害了 我这两天都在跑这个 甚至还有延伸到1M的上下文 被先破题了
@starryskyknight 再来1m上下文 我就有借口 上4卡 3090 了
-
,
T terry 固定了此主题