2x3090 NVLink 王者配置再度进化——SGLang dev507 + DFLASH2 全面复测,并发 249 t/s 新高峰
-
@stormaround
关于「DFLASH 牺牲视觉」:不会,正好今天实测验证了。DFLASH 只参与 decode 阶段(草稿出 token),图像编码在 prefill 阶段完成,两段正交。twolven 这个 AWQ 版视觉塔保留 bf16 未量化,模型卡原文就有 "vision still works"。今天 curl 直传图片实测:读图 100% 正确(形状/颜色/文字全对),同时段 DFLASH accept rate 0.28-0.40 照常跑,零冲突。真实照片测试连法文成分表都能正确 OCR。那还可以,之前用双r9700跑tp2,mtp和dflash速度差不多,就没有再去调dflash
@stormaround 有用就行。双 R9700 上 MTP/DFLASH 增益相近这个数据很宝贵,AMD 平台的 DFLASH 适配确实起步晚。这版 SGLang dev 对 DFLASH 动了不少(f60bc73c 修 TP 状态分歧 + draft cuda graph 默认启用),ROCm 下值得再试一轮。
-
还真就是王者了。NV显卡价格继续飙升。3090算是守门员了。
@williamlouis 主要是带宽管饱,两张 3090 够 27B 吃满, NVLink 把同步税砍掉后确实到头了。
-
@applejuice 350W 这组 prefill 档位数据收了,19k 181k 从 1966 掉到1141 t/s(-42%)、TTFT9.8s 159s,退化曲线 很有用。
不过有个反直觉点想对齐:350W 墙下代码 284.9 反而比无
墙 246.7高 15%,散文 72.7 也高 18%,英文/中文却掉 10-21%——不像功耗墙特征,更像 prompt 或热身后的状态差 (tok/chunk 也不一样:6.69 vs 6.32)。方便的话同 prompt 无墙再跑一轮对照?真复现了就是功耗墙时钟策略对某些负 载有利,那是个大发现。
350w 算是没功耗限制 3090 最高功耗好像就是350w
平常都是245w限制这个就是 245w限制
场景 ON (t/s) OFF (t/s) Δ decode tok/chunk ON tok/chunk OFF 代码生成 147.6 258.1 +74.9% 3.64 6.32 英文技术论述 109.2 147.2 +34.8% 2.69 3.63 中文常规对话 80.5 103.5 +28.6% 1.99 2.56 中文散文 67.0 64.3 −4.0% 1.67 1.60 对比350w 后面100w, 30%的功耗, 只换来10%+ 的性能
-
其實都是一樣,市售版(3slot) 3090 x 4 的飄過,雖然當初是想裝兩台做互相備援...
偉大的祖國怎麼沒人硬改 NVLINK 軟排長線...
剛看板主的窮人越窮有感而發... -
@Eric-Su 开放式 机箱吗 ?
我也想玩 4张
虽然说现阶段不需要@applejuice 沒,生產裝兩台(3945wx+WRX80E+128G DDR4)
的確有考慮買礦機架來裝,把手上5090/5070Ti都裝上去看看會怎樣
到時候再貼上來供大家娛樂
PS. EVGA(大哥) 3090 預設功耗可以到450W -
@neo 也太厉害了 我这两天都在跑这个 甚至还有延伸到1M的上下文 被先破题了
@starryskyknight 再来1m上下文 我就有借口 上4卡 3090 了
-
,
T terry 固定了此主题