<?xml version="1.0" encoding="UTF-8"?><rss xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title><![CDATA[2x3090 NVLink 王者配置再度进化——SGLang dev507 + DFLASH2 全面复测，并发 249 t/s 新高峰]]></title><description><![CDATA[<h1>双 3090 NVLink 王者配置再度进化：SGLang dev507 + DFLASH2 全面复测</h1>
<p dir="auto">接上一篇 133 t/s 的实测帖，这周做了两件大事：引擎升级 506 个 commits + 跑完整优化矩阵。结论先行：王者配置没变，但藏着一个被内存挤掉的关键优化，挖出来后并发冲到 249 t/s 新高峰。</p>
<h2>一、升级了什么</h2>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>项目</th>
<th>旧</th>
<th>新</th>
</tr>
</thead>
<tbody>
<tr>
<td>SGLang</td>
<td>8/26 快照</td>
<td>dev507（9/4 最新，506 commits）</td>
</tr>
<tr>
<td>关键修复</td>
<td>-</td>
<td>f60bc73c DFLASH TP 状态分歧修复</td>
</tr>
<tr>
<td>Kernel</td>
<td>7.0.0-30</td>
<td>7.0.0-31.31（swap_cgroup 崩溃修复版）</td>
</tr>
<tr>
<td>FlashInfer</td>
<td>0.6.17</td>
<td>0.6.18</td>
</tr>
</tbody>
</table>
<p dir="auto">其中 DFLASH TP 修复很重要：多轮长对话时 draft 模型状态会在 TP rank 间漂移，输出有潜在漂移风险，这版根除了。</p>
<h2>二、挖出的隐藏瓶颈</h2>
<p dir="auto">升级后翻启动日志，发现一行：</p>
<p dir="auto">Disable DFLASH draft cuda graph because only 0.93 GB GPU memory is available</p>
<p dir="auto">draft 模型的 CUDA graph 一直被内存挤掉！mem-fraction 0.94 留给 draft graph 的空间只剩 0.93GB，不够。降到 0.90 后：</p>
<ul>
<li>draft cuda graph 启用</li>
<li>selector decode（greedy + sampling）也折进 graph</li>
</ul>
<h2>三、优化矩阵实测（6 项，单变量）</h2>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>测试</th>
<th>结果</th>
<th>判定</th>
</tr>
</thead>
<tbody>
<tr>
<td>mem-fraction 0.94→0.90</td>
<td>draft graph 启用</td>
<td>采纳</td>
</tr>
<tr>
<td>dflash-block-size 16</td>
<td>并发 -28%</td>
<td>否决</td>
</tr>
<tr>
<td>dflash-block-size 4</td>
<td>JSON 场景 -18%</td>
<td>否决</td>
</tr>
<tr>
<td>tokenizer-worker-num 4</td>
<td>无增益</td>
<td>否决</td>
</tr>
<tr>
<td>fastokens（Rust tokenizer）</td>
<td>需 Rust toolchain</td>
<td>不适用</td>
</tr>
<tr>
<td>speculative-adaptive</td>
<td>仅支持 EAGLE</td>
<td>不适用</td>
</tr>
</tbody>
</table>
<p dir="auto">踩坑：DFLASH 强制 draft-tokens == block-size，不匹配直接 ValueError。</p>
<h2>四、最终数据（2x3090 NVLink TP2 + AWQ INT4 + DFLASH2）</h2>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>指标</th>
<th>数据</th>
</tr>
</thead>
<tbody>
<tr>
<td>并发 aggregate（2 路）</td>
<td>219.1 avg / 249.1 峰</td>
</tr>
<tr>
<td>JSON 工具调用并发</td>
<td>280.5 avg（峰 303.7）</td>
</tr>
<tr>
<td>短 prompt 单路</td>
<td>297.3</td>
</tr>
<tr>
<td>代码生成</td>
<td>254.0</td>
</tr>
<tr>
<td>中文散文</td>
<td>85.4</td>
</tr>
</tbody>
</table>
<p dir="auto">vs 旧帖 133 t/s：+65% ~ +87%。</p>
<p dir="auto">口径声明：并发 = 2 路 aggregate（双路同时生成的总吞吐）；单路端到端（含 prefill）一直 82-88 t/s。数字都是实测，无估算。</p>
<h2>五、配置</h2>
<p dir="auto">--mem-fraction-static 0.90<br />
--speculative-num-draft-tokens 8<br />
--speculative-dflash-block-size 8<br />
--tp-size 2 --kv-cache-dtype fp8_e5m2<br />
--chunked-prefill-size 2048 --max-running-requests 2</p>
<p dir="auto">完整报告和踩坑记录见回复区，欢迎交流。</p>
]]></description><link>https://lcz.me/topic/1502</link><generator>RSS for Node</generator><lastBuildDate>Wed, 09 Sep 2026 22:53:18 GMT</lastBuildDate><atom:link href="https://lcz.me/topic/1502.rss" rel="self" type="application/rss+xml"/><pubDate>Fri, 04 Sep 2026 12:58:43 GMT</pubDate><ttl>60</ttl><item><title><![CDATA[Reply to 2x3090 NVLink 王者配置再度进化——SGLang dev507 + DFLASH2 全面复测，并发 249 t/s 新高峰 on Tue, 08 Sep 2026 15:43:17 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/starryskyknight" aria-label="Profile: starryskyknight">@<bdi>starryskyknight</bdi></a> 再来1m上下文 我就有借口 上4卡 3090 了</p>
]]></description><link>https://lcz.me/post/16746</link><guid isPermaLink="true">https://lcz.me/post/16746</guid><dc:creator><![CDATA[applejuice]]></dc:creator><pubDate>Tue, 08 Sep 2026 15:43:17 GMT</pubDate></item><item><title><![CDATA[Reply to 2x3090 NVLink 王者配置再度进化——SGLang dev507 + DFLASH2 全面复测，并发 249 t/s 新高峰 on Tue, 08 Sep 2026 14:24:29 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/neo" aria-label="Profile: neo">@<bdi>neo</bdi></a> 也太厉害了 我这两天都在跑这个 甚至还有延伸到1M的上下文 被先破题了</p>
]]></description><link>https://lcz.me/post/16715</link><guid isPermaLink="true">https://lcz.me/post/16715</guid><dc:creator><![CDATA[starryskyknight]]></dc:creator><pubDate>Tue, 08 Sep 2026 14:24:29 GMT</pubDate></item><item><title><![CDATA[Reply to 2x3090 NVLink 王者配置再度进化——SGLang dev507 + DFLASH2 全面复测，并发 249 t/s 新高峰 on Tue, 08 Sep 2026 14:19:43 GMT]]></title><description><![CDATA[<p dir="auto">感谢分享，有可能的话可以测测长会话生成精度、质量如何，这个也很重要</p>
]]></description><link>https://lcz.me/post/16709</link><guid isPermaLink="true">https://lcz.me/post/16709</guid><dc:creator><![CDATA[neo]]></dc:creator><pubDate>Tue, 08 Sep 2026 14:19:43 GMT</pubDate></item><item><title><![CDATA[Reply to 2x3090 NVLink 王者配置再度进化——SGLang dev507 + DFLASH2 全面复测，并发 249 t/s 新高峰 on Tue, 08 Sep 2026 14:16:08 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/x%E4%B8%80%E6%A3%B5%E6%A0%91" aria-label="Profile: X一棵树">@<bdi>X一棵树</bdi></a><br />
这个特哥说了很多次 我不多说了......<br />
如果手上卡很多不要急...慢慢来......<br />
如果真的想证明 就跑实例出来让大家抄作业</p>
]]></description><link>https://lcz.me/post/16704</link><guid isPermaLink="true">https://lcz.me/post/16704</guid><dc:creator><![CDATA[starryskyknight]]></dc:creator><pubDate>Tue, 08 Sep 2026 14:16:08 GMT</pubDate></item><item><title><![CDATA[Reply to 2x3090 NVLink 王者配置再度进化——SGLang dev507 + DFLASH2 全面复测，并发 249 t/s 新高峰 on Tue, 08 Sep 2026 14:07:08 GMT]]></title><description><![CDATA[<p dir="auto">要说性价比，v100才是最有性价比</p>
]]></description><link>https://lcz.me/post/16699</link><guid isPermaLink="true">https://lcz.me/post/16699</guid><dc:creator><![CDATA[X一棵树]]></dc:creator><pubDate>Tue, 08 Sep 2026 14:07:08 GMT</pubDate></item><item><title><![CDATA[Reply to 2x3090 NVLink 王者配置再度进化——SGLang dev507 + DFLASH2 全面复测，并发 249 t/s 新高峰 on Tue, 08 Sep 2026 11:57:39 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/applejuice" aria-label="Profile: applejuice">@<bdi>applejuice</bdi></a> 沒，生產裝兩台(3945wx+WRX80E+128G DDR4)<br />
的確有考慮買礦機架來裝，把手上5090/5070Ti都裝上去看看會怎樣<br />
到時候再貼上來供大家娛樂<br />
PS. EVGA(大哥) 3090  預設功耗可以到450W</p>
]]></description><link>https://lcz.me/post/16666</link><guid isPermaLink="true">https://lcz.me/post/16666</guid><dc:creator><![CDATA[Eric Su]]></dc:creator><pubDate>Tue, 08 Sep 2026 11:57:39 GMT</pubDate></item><item><title><![CDATA[Reply to 2x3090 NVLink 王者配置再度进化——SGLang dev507 + DFLASH2 全面复测，并发 249 t/s 新高峰 on Tue, 08 Sep 2026 11:49:16 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/eric-su" aria-label="Profile: Eric-Su">@<bdi>Eric-Su</bdi></a> 开放式 机箱吗 ？<br />
我也想玩 4张<br />
虽然说现阶段不需要</p>
]]></description><link>https://lcz.me/post/16665</link><guid isPermaLink="true">https://lcz.me/post/16665</guid><dc:creator><![CDATA[applejuice]]></dc:creator><pubDate>Tue, 08 Sep 2026 11:49:16 GMT</pubDate></item><item><title><![CDATA[Reply to 2x3090 NVLink 王者配置再度进化——SGLang dev507 + DFLASH2 全面复测，并发 249 t/s 新高峰 on Tue, 08 Sep 2026 11:43:08 GMT]]></title><description><![CDATA[<p dir="auto">其實都是一樣，市售版(3slot) 3090 x 4 的飄過，雖然當初是想裝兩台做互相備援...<br />
偉大的祖國怎麼沒人硬改 NVLINK 軟排長線...<br />
剛看板主的窮人越窮有感而發...</p>
]]></description><link>https://lcz.me/post/16662</link><guid isPermaLink="true">https://lcz.me/post/16662</guid><dc:creator><![CDATA[Eric Su]]></dc:creator><pubDate>Tue, 08 Sep 2026 11:43:08 GMT</pubDate></item><item><title><![CDATA[Reply to 2x3090 NVLink 王者配置再度进化——SGLang dev507 + DFLASH2 全面复测，并发 249 t/s 新高峰 on Tue, 08 Sep 2026 02:00:49 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/starryskyknight" aria-label="Profile: starryskyknight">@<bdi>starryskyknight</bdi></a></p>
<p dir="auto">350w 算是没功耗限制 3090 最高功耗好像就是350w<br />
平常都是245w限制</p>
<p dir="auto">这个就是 245w限制</p>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>场景</th>
<th style="text-align:right">ON (t/s)</th>
<th style="text-align:right">OFF (t/s)</th>
<th style="text-align:right">Δ decode</th>
<th style="text-align:right">tok/chunk ON</th>
<th style="text-align:right">tok/chunk OFF</th>
</tr>
</thead>
<tbody>
<tr>
<td>代码生成</td>
<td style="text-align:right">147.6</td>
<td style="text-align:right"><strong>258.1</strong></td>
<td style="text-align:right"><strong>+74.9%</strong></td>
<td style="text-align:right">3.64</td>
<td style="text-align:right">6.32</td>
</tr>
<tr>
<td>英文技术论述</td>
<td style="text-align:right">109.2</td>
<td style="text-align:right">147.2</td>
<td style="text-align:right">+34.8%</td>
<td style="text-align:right">2.69</td>
<td style="text-align:right">3.63</td>
</tr>
<tr>
<td>中文常规对话</td>
<td style="text-align:right">80.5</td>
<td style="text-align:right">103.5</td>
<td style="text-align:right">+28.6%</td>
<td style="text-align:right">1.99</td>
<td style="text-align:right">2.56</td>
</tr>
<tr>
<td>中文散文</td>
<td style="text-align:right">67.0</td>
<td style="text-align:right">64.3</td>
<td style="text-align:right">−4.0%</td>
<td style="text-align:right">1.67</td>
<td style="text-align:right">1.60</td>
</tr>
</tbody>
</table>
<p dir="auto">对比350w 后面100w, 30%的功耗, 只换来10%+ 的性能</p>
]]></description><link>https://lcz.me/post/16567</link><guid isPermaLink="true">https://lcz.me/post/16567</guid><dc:creator><![CDATA[applejuice]]></dc:creator><pubDate>Tue, 08 Sep 2026 02:00:49 GMT</pubDate></item><item><title><![CDATA[Reply to 2x3090 NVLink 王者配置再度进化——SGLang dev507 + DFLASH2 全面复测，并发 249 t/s 新高峰 on Mon, 07 Sep 2026 17:57:03 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/williamlouis" aria-label="Profile: williamlouis">@<bdi>williamlouis</bdi></a> 主要是带宽管饱,两张 3090 够 27B 吃满, NVLink 把同步税砍掉后确实到头了。</p>
]]></description><link>https://lcz.me/post/16550</link><guid isPermaLink="true">https://lcz.me/post/16550</guid><dc:creator><![CDATA[starryskyknight]]></dc:creator><pubDate>Mon, 07 Sep 2026 17:57:03 GMT</pubDate></item><item><title><![CDATA[Reply to 2x3090 NVLink 王者配置再度进化——SGLang dev507 + DFLASH2 全面复测，并发 249 t/s 新高峰 on Mon, 07 Sep 2026 17:54:13 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/stormaround" aria-label="Profile: stormaround">@<bdi>stormaround</bdi></a> 有用就行。双 R9700 上 MTP/DFLASH 增益相近这个数据很宝贵，AMD 平台的 DFLASH 适配确实起步晚。这版 SGLang dev 对 DFLASH 动了不少（f60bc73c 修 TP 状态分歧 + draft cuda graph 默认启用），ROCm 下值得再试一轮。</p>
]]></description><link>https://lcz.me/post/16549</link><guid isPermaLink="true">https://lcz.me/post/16549</guid><dc:creator><![CDATA[starryskyknight]]></dc:creator><pubDate>Mon, 07 Sep 2026 17:54:13 GMT</pubDate></item><item><title><![CDATA[Reply to 2x3090 NVLink 王者配置再度进化——SGLang dev507 + DFLASH2 全面复测，并发 249 t/s 新高峰 on Mon, 07 Sep 2026 17:52:01 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/don-zhu" aria-label="Profile: Don-zhu">@<bdi>Don-zhu</bdi></a> 收到，三个问题逐一回：</p>
<p dir="auto">PCIe：我这边也是 x8+x8——Z890 平台 CPU 直出 20 lanes，x16 槽拆 x8/x8（PCIe 5.0），两卡各 x8，跟你一样。唯一物理差异就是 NVLink 桥。</p>
<p dir="auto">CPU：Core Ultra 9 285K（24 线程）——巧了，跟你 13700K 线程数一样，所以并发差距不在 CPU 线程数。先说个口径：我 OFF 同 prompt 是 518.4 / 不同 550.8（不是 440）。真正的差距在你的 NCCL_P2P_DISABLE=1：TP=2 每步同步激活，你禁 P2P 后同步走 host 内存中转，并发多路时同步次数放大，差距就显形了。证据是模式：单路 218 vs 270（-19%），并发 -31%~-33%，差距随并发放大正是同步带宽特征。验证方法：打 smcleod/nvidia-p2p-patch 开 P2P（无 NVLink 的 3090 跨卡 P2P 默认被驱动锁，patch 后走 PCIe 4.0 x8 双向 ~16GB/s，远好于 host 中转），重跑并发——差距缩到 ~20% 以内就证伪 CPU 假设了。</p>
<p dir="auto">mem-fraction 0.90：0.94 时日志打 Disable DFLASH draft cuda graph because only 0.93 GB GPU memory is available——graph 被挤掉；0.90 恢复启用（selector decode 也折叠进去）。精确 avail 我没记，估算 0.90 时 ~1.9GB 上下，看你自己启动日志这行的数字最准。你 0.88 单路略好我信，但会压缩 KV cache 上限，长 context 档位先吃紧，看用途取舍。</p>
]]></description><link>https://lcz.me/post/16548</link><guid isPermaLink="true">https://lcz.me/post/16548</guid><dc:creator><![CDATA[starryskyknight]]></dc:creator><pubDate>Mon, 07 Sep 2026 17:52:01 GMT</pubDate></item><item><title><![CDATA[Reply to 2x3090 NVLink 王者配置再度进化——SGLang dev507 + DFLASH2 全面复测，并发 249 t/s 新高峰 on Mon, 07 Sep 2026 17:55:32 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/applejuice" aria-label="Profile: applejuice">@<bdi>applejuice</bdi></a> 350W 这组 prefill 档位数据收了,19k 181k 从 1966 掉到1141 t/s(-42%)、TTFT9.8s 159s,退化曲线 很有用。</p>
<p dir="auto">不过有个反直觉点想对齐:350W 墙下代码 284.9 反而比无</p>
<p dir="auto">墙 246.7高 15%,散文 72.7 也高 18%,英文/中文却掉 10-21%——不像功耗墙特征,更像 prompt 或热身后的状态差 (tok/chunk 也不一样:6.69 vs 6.32)。方便的话同 prompt 无墙再跑一轮对照?真复现了就是功耗墙时钟策略对某些负 载有利,那是个大发现。</p>
]]></description><link>https://lcz.me/post/16538</link><guid isPermaLink="true">https://lcz.me/post/16538</guid><dc:creator><![CDATA[starryskyknight]]></dc:creator><pubDate>Mon, 07 Sep 2026 17:55:32 GMT</pubDate></item><item><title><![CDATA[Reply to 2x3090 NVLink 王者配置再度进化——SGLang dev507 + DFLASH2 全面复测，并发 249 t/s 新高峰 on Mon, 07 Sep 2026 15:13:55 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/applejuice" aria-label="Profile: applejuice">@<bdi>applejuice</bdi></a> 感谢回复。我也觉得是这个问题。</p>
]]></description><link>https://lcz.me/post/16507</link><guid isPermaLink="true">https://lcz.me/post/16507</guid><dc:creator><![CDATA[Don zhu]]></dc:creator><pubDate>Mon, 07 Sep 2026 15:13:55 GMT</pubDate></item><item><title><![CDATA[Reply to 2x3090 NVLink 王者配置再度进化——SGLang dev507 + DFLASH2 全面复测，并发 249 t/s 新高峰 on Mon, 07 Sep 2026 15:08:09 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/don-zhu" aria-label="Profile: Don-zhu">@<bdi>Don-zhu</bdi></a> 我觉得差不多 一方面你没有nvlink 然后 pcie x8</p>
]]></description><link>https://lcz.me/post/16503</link><guid isPermaLink="true">https://lcz.me/post/16503</guid><dc:creator><![CDATA[applejuice]]></dc:creator><pubDate>Mon, 07 Sep 2026 15:08:09 GMT</pubDate></item><item><title><![CDATA[Reply to 2x3090 NVLink 王者配置再度进化——SGLang dev507 + DFLASH2 全面复测，并发 249 t/s 新高峰 on Tue, 08 Sep 2026 01:56:39 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/don-zhu" aria-label="Profile: Don-zhu">@<bdi>Don-zhu</bdi></a> prefill 多少</p>
<p dir="auto">楼主是nvlink pcie 也不重要了，因为都显卡数据交换 经过nvlink 不经过pcie</p>
<p dir="auto">你的是x8 我的是x16 分别就是这里</p>
<p dir="auto">单路 decode，rounds=3、max_tokens=512、temperature=0, NCCL_P2P_DISABLE=0, NCCL_P2P_LEVEL=SYS,  disable_custom_all_reduce=true, 245w 功耗</p>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>场景</th>
<th style="text-align:right">ON (t/s)</th>
<th style="text-align:right">OFF (t/s)</th>
<th style="text-align:right">Δ decode</th>
<th style="text-align:right">tok/chunk ON</th>
<th style="text-align:right">tok/chunk OFF</th>
</tr>
</thead>
<tbody>
<tr>
<td>代码生成</td>
<td style="text-align:right">147.6</td>
<td style="text-align:right"><strong>258.1</strong></td>
<td style="text-align:right"><strong>+74.9%</strong></td>
<td style="text-align:right">3.64</td>
<td style="text-align:right">6.32</td>
</tr>
<tr>
<td>英文技术论述</td>
<td style="text-align:right">109.2</td>
<td style="text-align:right">147.2</td>
<td style="text-align:right">+34.8%</td>
<td style="text-align:right">2.69</td>
<td style="text-align:right">3.63</td>
</tr>
<tr>
<td>中文常规对话</td>
<td style="text-align:right">80.5</td>
<td style="text-align:right">103.5</td>
<td style="text-align:right">+28.6%</td>
<td style="text-align:right">1.99</td>
<td style="text-align:right">2.56</td>
</tr>
<tr>
<td>中文散文</td>
<td style="text-align:right">67.0</td>
<td style="text-align:right">64.3</td>
<td style="text-align:right">−4.0%</td>
<td style="text-align:right">1.67</td>
<td style="text-align:right">1.60</td>
</tr>
</tbody>
</table>
<p dir="auto">并发 2 路 aggregate decode（代码场景）：</p>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>并发模式</th>
<th style="text-align:right">ON (t/s)</th>
<th style="text-align:right">OFF (t/s)</th>
<th style="text-align:right">Δ</th>
<th style="text-align:right">OFF 相对单路</th>
</tr>
</thead>
<tbody>
<tr>
<td>同 prompt（radix 命中）</td>
<td style="text-align:right">232.2</td>
<td style="text-align:right"><strong>463.7</strong></td>
<td style="text-align:right">+99.7%</td>
<td style="text-align:right">×1.80</td>
</tr>
<tr>
<td>不同 prompt</td>
<td style="text-align:right">221.1</td>
<td style="text-align:right">433.2</td>
<td style="text-align:right">+95.9%</td>
<td style="text-align:right">×1.68</td>
</tr>
</tbody>
</table>
<h2>Prefill</h2>
<p dir="auto">唯一随机 prompt（规避 radix 命中），<code>max_tokens=1</code>，rounds=2 取最快。<br />
固定开销标定 <strong>411 ms</strong>（极短 prompt 最小 TTFT，5 次取 min）。</p>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th style="text-align:right">实际 prompt_tokens</th>
<th style="text-align:right">TTFT (s)</th>
<th style="text-align:right">原始 t/s</th>
<th style="text-align:right">扣除开销 t/s</th>
</tr>
</thead>
<tbody>
<tr>
<td style="text-align:right">2,160</td>
<td style="text-align:right">1.529</td>
<td style="text-align:right">1413</td>
<td style="text-align:right">1933 <img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/26a0.png?v=301515bb865" class="not-responsive emoji emoji-android emoji--warning" style="height:23px;width:auto;vertical-align:middle" title="⚠" alt="⚠" />️</td>
</tr>
<tr>
<td style="text-align:right">8,502</td>
<td style="text-align:right">5.167</td>
<td style="text-align:right">1645</td>
<td style="text-align:right">1788</td>
</tr>
<tr>
<td style="text-align:right">16,982</td>
<td style="text-align:right">10.304</td>
<td style="text-align:right"><strong>1648</strong></td>
<td style="text-align:right">1717</td>
</tr>
<tr>
<td style="text-align:right">33,703</td>
<td style="text-align:right">21.657</td>
<td style="text-align:right">1556</td>
<td style="text-align:right">1586</td>
</tr>
<tr>
<td style="text-align:right">67,642</td>
<td style="text-align:right">49.198</td>
<td style="text-align:right">1375</td>
<td style="text-align:right">1386</td>
</tr>
<tr>
<td style="text-align:right">137,835</td>
<td style="text-align:right">124.093</td>
<td style="text-align:right">1111</td>
<td style="text-align:right">1114</td>
</tr>
</tbody>
</table>
]]></description><link>https://lcz.me/post/16502</link><guid isPermaLink="true">https://lcz.me/post/16502</guid><dc:creator><![CDATA[applejuice]]></dc:creator><pubDate>Tue, 08 Sep 2026 01:56:39 GMT</pubDate></item><item><title><![CDATA[Reply to 2x3090 NVLink 王者配置再度进化——SGLang dev507 + DFLASH2 全面复测，并发 249 t/s 新高峰 on Mon, 07 Sep 2026 15:06:53 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/johnnybegood" aria-label="Profile: johnnybegood">@<bdi>johnnybegood</bdi></a> 说明我的配置还有问题，我让deepseek再调 ：）</p>
]]></description><link>https://lcz.me/post/16501</link><guid isPermaLink="true">https://lcz.me/post/16501</guid><dc:creator><![CDATA[Don zhu]]></dc:creator><pubDate>Mon, 07 Sep 2026 15:06:53 GMT</pubDate></item><item><title><![CDATA[Reply to 2x3090 NVLink 王者配置再度进化——SGLang dev507 + DFLASH2 全面复测，并发 249 t/s 新高峰 on Mon, 07 Sep 2026 14:57:34 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/don-zhu" aria-label="Profile: Don-zhu">@<bdi>Don-zhu</bdi></a> 我这 3090+3080的奇葩组合Decode都到 199 t/s 了。。。</p>
]]></description><link>https://lcz.me/post/16499</link><guid isPermaLink="true">https://lcz.me/post/16499</guid><dc:creator><![CDATA[johnnybegood]]></dc:creator><pubDate>Mon, 07 Sep 2026 14:57:34 GMT</pubDate></item><item><title><![CDATA[Reply to 2x3090 NVLink 王者配置再度进化——SGLang dev507 + DFLASH2 全面复测，并发 249 t/s 新高峰 on Mon, 07 Sep 2026 14:25:42 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/starryskyknight" aria-label="Profile: starryskyknight">@<bdi>starryskyknight</bdi></a> 同配置复测来了，先报数据再请教硬件。</p>
<p dir="auto">环境：SGLang 0.5.19 + twolven AWQ-MTP + incoai DFlash2（8/8, fp8_e5m2, mem 0.88, mamba 20, TP2, NCCL_P2P_DISABLE=1），你的统一脚本，t=0 / 512 tok / 3 rounds，thinking OFF：</p>
<p dir="auto">单路 decode：代码 218.0 t/s（LRU prompt）、TTFT 0.06-0.10s<br />
并发 2 路：同 prompt 355.2、不同 prompt 367.1</p>
<p dir="auto">想对齐几个硬件问题：</p>
<ol>
<li>我这边 2×3090 走主板 PCIe x8+x8（i7-13700K，Z690），无 NVLink，NCCL P2P 已禁用。你那边 3090 是 x16 还是 x8？NVLink 之外主板的 PCIe 分配是？</li>
<li>CPU 是什么？我在猜并发 355 vs 你 440 的差距主要来自 CPU/PCIe lanes（我是 24 线程桌面平台），不是模型或 SGLang 参数——想验证这个假设。</li>
<li>mem-fraction 你用 0.90，我试过 0.88（给 draft graph 多点空间）单路略好，0.93 会挤 draft graph。你 0.90 时 draft graph avail mem 大概多少？</li>
</ol>
<p dir="auto">applejuice 兄的 EPYC 7452 数据（无 NVLink）我这边基本复现了（单路 218 vs 他 246，约 9% 差），所以怀疑剩的差距是纯平台带宽/核数。</p>
]]></description><link>https://lcz.me/post/16489</link><guid isPermaLink="true">https://lcz.me/post/16489</guid><dc:creator><![CDATA[Don zhu]]></dc:creator><pubDate>Mon, 07 Sep 2026 14:25:42 GMT</pubDate></item><item><title><![CDATA[Reply to 2x3090 NVLink 王者配置再度进化——SGLang dev507 + DFLASH2 全面复测，并发 249 t/s 新高峰 on Sun, 06 Sep 2026 07:54:08 GMT]]></title><description><![CDATA[<p dir="auto">无聊测试350w, thinking mode off</p>
<h2>Decode (tokens/s, median of 3, spread in brackets)</h2>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>Case</th>
<th>350 W</th>
<th>tok/chunk</th>
</tr>
</thead>
<tbody>
<tr>
<td>中文散文</td>
<td>72.7 (72.4–72.8)</td>
<td>2.06</td>
</tr>
<tr>
<td>中文常规对话</td>
<td>78.4 (78.3–78.5)</td>
<td>1.94</td>
</tr>
<tr>
<td>English technical</td>
<td>126.0 (126.0–126.1)</td>
<td>2.97</td>
</tr>
<tr>
<td>Code generation</td>
<td>284.9 (284.8–285.0)</td>
<td>6.69</td>
</tr>
</tbody>
</table>
<h2>Prefill (tokens/s)</h2>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>Prompt tokens</th>
<th>350 W</th>
<th>TTFT</th>
</tr>
</thead>
<tbody>
<tr>
<td>19 206</td>
<td>1966</td>
<td>9.8 s</td>
</tr>
<tr>
<td>43 036</td>
<td>1781</td>
<td>24.2 s</td>
</tr>
<tr>
<td>88 907</td>
<td>1499</td>
<td>59.3 s</td>
</tr>
<tr>
<td>181 307</td>
<td>1141</td>
<td>159.0 s</td>
</tr>
</tbody>
</table>
]]></description><link>https://lcz.me/post/16171</link><guid isPermaLink="true">https://lcz.me/post/16171</guid><dc:creator><![CDATA[applejuice]]></dc:creator><pubDate>Sun, 06 Sep 2026 07:54:08 GMT</pubDate></item><item><title><![CDATA[Reply to 2x3090 NVLink 王者配置再度进化——SGLang dev507 + DFLASH2 全面复测，并发 249 t/s 新高峰 on Sat, 05 Sep 2026 15:11:28 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/johnnybegood" aria-label="Profile: johnnybegood">@<bdi>johnnybegood</bdi></a> 要是我知道nvlink 用不了 我都选择3080<br />
但是现在已经上车了 没得回头</p>
]]></description><link>https://lcz.me/post/16059</link><guid isPermaLink="true">https://lcz.me/post/16059</guid><dc:creator><![CDATA[applejuice]]></dc:creator><pubDate>Sat, 05 Sep 2026 15:11:28 GMT</pubDate></item><item><title><![CDATA[Reply to 2x3090 NVLink 王者配置再度进化——SGLang dev507 + DFLASH2 全面复测，并发 249 t/s 新高峰 on Sat, 05 Sep 2026 15:07:31 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/applejuice" aria-label="Profile: applejuice">@<bdi>applejuice</bdi></a> 现在看来双卡3080 20g 可能是性价比最高的了。 内存够大， 性能也能打。 现在3080 20G咸鱼才 3600左右， 两块还不如一块3090贵。</p>
]]></description><link>https://lcz.me/post/16058</link><guid isPermaLink="true">https://lcz.me/post/16058</guid><dc:creator><![CDATA[johnnybegood]]></dc:creator><pubDate>Sat, 05 Sep 2026 15:07:31 GMT</pubDate></item><item><title><![CDATA[Reply to 2x3090 NVLink 王者配置再度进化——SGLang dev507 + DFLASH2 全面复测，并发 249 t/s 新高峰 on Sat, 05 Sep 2026 12:51:45 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/johnnybegood" aria-label="Profile: johnnybegood">@<bdi>johnnybegood</bdi></a> 你的很好了 毕竟花的钱有分别<br />
我比较惨 钱都花了 但是nvlink 用不上<br />
为了有比较好的速度 还花多4000 上epyc 7452</p>
]]></description><link>https://lcz.me/post/16029</link><guid isPermaLink="true">https://lcz.me/post/16029</guid><dc:creator><![CDATA[applejuice]]></dc:creator><pubDate>Sat, 05 Sep 2026 12:51:45 GMT</pubDate></item><item><title><![CDATA[Reply to 2x3090 NVLink 王者配置再度进化——SGLang dev507 + DFLASH2 全面复测，并发 249 t/s 新高峰 on Sat, 05 Sep 2026 10:57:06 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/johnnybegood" aria-label="Profile: johnnybegood">@<bdi>johnnybegood</bdi></a> 对齐口径后你的两个问题都有答案了:</p>
<p dir="auto"><strong>3090+3080 = 我的 69.8%, 不到 80%</strong> (188.5/270.2, 同 thinking OFF 同脚本). 原因两个都是硬伤:</p>
<ol>
<li><strong>前向被 3080 拖住</strong>: TP=2 平均分算力, 你 33 次/s vs 我 50 次/s -- TP 同步永远等最慢那张卡, 楼上 applejuice 说的没错, 平均分配救不了</li>
<li><strong>20GB 锁死 mem-fraction</strong>: SGLang 按最小卡分配, draft 模型和 KV cache 空间受限, CUDA graph 可能也开不起来</li>
</ol>
<p dir="auto">"哪里怪怪的": 你的 TTFT (0.098s) 反而比我快, 是 radix 命中+短 prompt, 但 decode 阶段短板效应全部显形.</p>
<p dir="auto"><strong>双 3090 vs 单张 48G 4090</strong>: 数据说话 -- 单张 4090 跑 27B AWQ+MTP 公开实测 ~65 t/s (24G 版), 48G 版会好一些但撑死 ~130. 我这套 thinking OFF 代码 270, 并发 550. 4090 单卡优势是省电省心, 绝对速度不在一个量级. 内存双通道那个类比不成立: TP=2 是张量切分不是带宽叠加, 两张 3090 不等于一张 4090x2.</p>
]]></description><link>https://lcz.me/post/16023</link><guid isPermaLink="true">https://lcz.me/post/16023</guid><dc:creator><![CDATA[starryskyknight]]></dc:creator><pubDate>Sat, 05 Sep 2026 10:57:06 GMT</pubDate></item></channel></rss>