-
感谢分享,同双 3090 NVLink 4-link + SGLang 0.5.18,果断换去了AWQ。我同时测了 shawnw3i/Qwen3.8-27B-AWQ-MTP(标准)和 twolven/...-abliterated-AWQ-MTP(去审查):
实测对比(正确的 token 口径)
另外加一点:功率墙有甜点。 我的机器有功率限制,扫了一遍:180W→62 t/s、220W→116、260W→162、300W→170。260W 是甜点(往上只 +5%,往下掉 28%)。如果楼主那台想控温/控电,可以试 260W,几乎不掉速。
-
感谢分享,同双 3090 NVLink 4-link + SGLang 0.5.18,果断换去了AWQ。我同时测了 shawnw3i/Qwen3.8-27B-AWQ-MTP(标准)和 twolven/...-abliterated-AWQ-MTP(去审查):
实测对比(正确的 token 口径)
另外加一点:功率墙有甜点。 我的机器有功率限制,扫了一遍:180W→62 t/s、220W→116、260W→162、300W→170。260W 是甜点(往上只 +5%,往下掉 28%)。如果楼主那台想控温/控电,可以试 260W,几乎不掉速。
-
,
T terry 固定了此主题
-
,
T terry 将此主题从 LLM讨论区 移至此处
-
,系统 取消固定了此主题
-
@Leon-Y 二位的主板和CPU是什么样的呢? @applejuice
-
感谢分享,同双 3090 NVLink 4-link + SGLang 0.5.18,果断换去了AWQ。我同时测了 shawnw3i/Qwen3.8-27B-AWQ-MTP(标准)和 twolven/...-abliterated-AWQ-MTP(去审查):
实测对比(正确的 token 口径)
另外加一点:功率墙有甜点。 我的机器有功率限制,扫了一遍:180W→62 t/s、220W→116、260W→162、300W→170。260W 是甜点(往上只 +5%,往下掉 28%)。如果楼主那台想控温/控电,可以试 260W,几乎不掉速。
@Leon-Y 感谢同配置实测,260W 甜点的数据很有参考价值!涡轮卡起飞噪音我也深受其害,回头照你的区间测一下 245-260W。
顺便更新我这边的最新状态(9/1 实测,SGLang main + zlab DFLASH2 draft):
- 单路端到端(2500 token 长输出含 prefill):82-84 t/s
- 双路并发 aggregate:151 t/s,峰值 161
之前帖子里说的 108/133 都是并发口径,单路口径一直就是这个数。DFLASH2 相比 EAGLE 的提升在并发场景更明显(+40% 左右)。
另外这两天 SGLang main 更新比较勤,我做了 A/B 对比(8/29 版 vs 9/1 版),性能一致无 regression,可以放心 pull。
你那边 162/150 是单路还是并发口径?想对齐一下数据。
-
@Leon-Y 感谢同配置实测,260W 甜点的数据很有参考价值!涡轮卡起飞噪音我也深受其害,回头照你的区间测一下 245-260W。
顺便更新我这边的最新状态(9/1 实测,SGLang main + zlab DFLASH2 draft):
- 单路端到端(2500 token 长输出含 prefill):82-84 t/s
- 双路并发 aggregate:151 t/s,峰值 161
之前帖子里说的 108/133 都是并发口径,单路口径一直就是这个数。DFLASH2 相比 EAGLE 的提升在并发场景更明显(+40% 左右)。
另外这两天 SGLang main 更新比较勤,我做了 A/B 对比(8/29 版 vs 9/1 版),性能一致无 regression,可以放心 pull。
你那边 162/150 是单路还是并发口径?想对齐一下数据。
-
@starryskyknight
我这边 162 是单路口径,而且单路下测出来跨度很大:内容 单路解码
数字计数(高可预测) ~162-168 t/s
JSON/结构化 ~168 t/s
Python 代码 ~130 t/s
英文/中英混合 ~98-102 t/s
中文散文(典型) ~77-85 t/s@Leon-Y 感谢分享!同为双 3090 NVLink,你的 260W 功率墙下 MTP 单路 162-168 t/s 已经很猛了。我们刚从 MTP 换到 DFLASH2,用同口径数据做个对照:
唯一干净的同口径(单路端到端):
场景 你的(SGLang 0.5.18 + MTP) 我们的(dev507 + DFLASH2) 中文散文 77-85 t/s 85.4 t/s 中文散文我们只赢 5-10%——中文可预测性低是共同天花板,DFLASH2 在这类场景优势不大,这和你的观察一致。
高可预测场景(口径不同,仅供参考):
- 你:数字计数单路 decode 162-168 / JSON 168 / Python 130
- 我们:JSON 并发 280.5(峰 303.7)/ Python 并发 254 / 短 prompt 单路 297.3
我们没测「数字计数单路 decode」这个口径,不能直接比。但 DFLASH2 一次接受的 token 数(代码场景平均 6.69)比 MTP 3 token 高一倍多,越可预测的场景差距越大。
三个差异点:
- 引擎代差:dev507 是 dev 分支,比 0.5.18 稳定版多了 DFLASH2 等一大票新特性
- 你的 260W 甜点(260→162 vs 300→170 只差 5%)很有价值,涡轮卡控温控噪刚需
- 我们没功率限制,满血跑
欢迎来 1502 帖子交流,那边有我们 DFLASH2 完整部署踩坑记录,以及「DFLASH 牺牲视觉」的实测辟谣(视觉任务思考开/关的 A/B 数据都有)。
-
@Leon-Y 感谢分享!同为双 3090 NVLink,你的 260W 功率墙下 MTP 单路 162-168 t/s 已经很猛了。我们刚从 MTP 换到 DFLASH2,用同口径数据做个对照:
唯一干净的同口径(单路端到端):
场景 你的(SGLang 0.5.18 + MTP) 我们的(dev507 + DFLASH2) 中文散文 77-85 t/s 85.4 t/s 中文散文我们只赢 5-10%——中文可预测性低是共同天花板,DFLASH2 在这类场景优势不大,这和你的观察一致。
高可预测场景(口径不同,仅供参考):
- 你:数字计数单路 decode 162-168 / JSON 168 / Python 130
- 我们:JSON 并发 280.5(峰 303.7)/ Python 并发 254 / 短 prompt 单路 297.3
我们没测「数字计数单路 decode」这个口径,不能直接比。但 DFLASH2 一次接受的 token 数(代码场景平均 6.69)比 MTP 3 token 高一倍多,越可预测的场景差距越大。
三个差异点:
- 引擎代差:dev507 是 dev 分支,比 0.5.18 稳定版多了 DFLASH2 等一大票新特性
- 你的 260W 甜点(260→162 vs 300→170 只差 5%)很有价值,涡轮卡控温控噪刚需
- 我们没功率限制,满血跑
欢迎来 1502 帖子交流,那边有我们 DFLASH2 完整部署踩坑记录,以及「DFLASH 牺牲视觉」的实测辟谣(视觉任务思考开/关的 A/B 数据都有)。
-
@starryskyknight DFlash或者DSpark会更有前途,因为工作原理有差距,它草稿模型先工作,主模型验证,这样很多时候连显卡风扇都不转。