<?xml version="1.0" encoding="UTF-8"?><rss xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title><![CDATA[Deepseek v4.1 flash , 4台DGX spark GB10, TP=4]]></title><description><![CDATA[<p dir="auto">V4.1 flash釋出沒多久, DGX論壇上已經有幾個看起來不錯的配方了, 今天選了一個裝起來, 速度很讓人驚豔, 實際品質未知, 等跑了幾天實際任務再update. 實際工作單條工作流約40-60 tok/s, 三條約50-100 tok/s. prefill速度在2500 ~ 3000 tok/s左右, 快取命中約99%.</p>
<p dir="auto">使用方案: <a href="https://github.com/MiaAI-Lab/DeepSeek-v4.1-Flash-DGX-Sparks" rel="nofollow ugc">https://github.com/MiaAI-Lab/DeepSeek-v4.1-Flash-DGX-Sparks</a> , 模型為官方原始模型. 用Antigravity cli + gemini flash 3.8 安裝, 過程遇到幾個坑它自行解決, 安裝資訊與測試數據如下:</p>
<h1>DeepSeek-V4.1-Flash TP4 部署與測試總結報告 (Summary)</h1>
<hr />
<h2>一、 模型與服務基本資訊</h2>
<ul>
<li><strong>模型名稱 (Model Name)</strong>：<code>deepseek-ai/DeepSeek-V4.1-Flash</code></li>
<li><strong>權重版本 (Pinned Revision)</strong>：<code>fb2764a5cf321eaa5070ca8f9e892818f477c16d</code></li>
<li><strong>上游原生路線</strong>：MiaAI-Lab TP4 原生路由 (<code>https://github.com/MiaAI-Lab/DeepSeek-v4.1-Flash-DGX-Sparks</code>)</li>
<li><strong>硬體環境</strong>：4× NVIDIA DGX Spark (GB10, aarch64, 單節點 121.7 GiB 統一記憶體)</li>
<li><strong>高速網路互連</strong>：200G RoCEv2 (<code>rocep1s0f0</code> / <code>enp1s0f0np0</code>), MTU 9000 (Jumbo Frames), GID Index 3</li>
</ul>
<blockquote>
<p dir="auto"><strong>權重存儲與掛載</strong>：完整模型權重（476 GB，48 個 safetensors 分片）存放於 HEAD 本地 NVMe，透過 RoCE 容器化 NFSv4 (<code>dsv41-weights</code>) 共享給 WORKERS 唯讀掛載，各節點無重複複製。</p>
</blockquote>
<hr />
<h2>二、 核心規格與配置參數 (Core Specs &amp; Configurations)</h2>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th style="text-align:left">核心參數</th>
<th style="text-align:left">數值 / 設定</th>
<th style="text-align:left">說明</th>
</tr>
</thead>
<tbody>
<tr>
<td style="text-align:left"><strong>Context Length (ctx size)</strong></td>
<td style="text-align:left"><strong>1,048,576</strong> (1M tokens)</td>
<td style="text-align:left">模型原生完整支援長度；生產實測認證邊界依上游 Proxy 設定為 <strong>500K tokens</strong></td>
</tr>
<tr>
<td style="text-align:left"><strong>Max Running Requests (max seq num)</strong></td>
<td style="text-align:left"><strong>8</strong></td>
<td style="text-align:left">支援最大並行請求數，CUDA Graph 完整捕獲 Batch Size 1 ~ 8</td>
</tr>
<tr>
<td style="text-align:left"><strong>KV Cache Pool Size (kv cache size)</strong></td>
<td style="text-align:left"><strong>4,000,000</strong> (4M tokens)</td>
<td style="text-align:left">每 Rank 分配 1,000,000 tokens，<strong>100% 完整採納（零 downscaling 降級）</strong>，FP8</td>
</tr>
<tr>
<td style="text-align:left">精度</td>
</tr>
<tr>
<td style="text-align:left"><strong>靜態記憶體比例 (Mem Fraction Static)</strong></td>
<td style="text-align:left"><code>0.78</code> (Head: <code>0.78</code>)</td>
<td style="text-align:left">預留 ~94.9 GB 靜態預算，保證 4M KV pool 成功分配，並為各節點留出 18~20 GiB 實體</td>
</tr>
<tr>
<td style="text-align:left">記憶體空間</td>
</tr>
<tr>
<td style="text-align:left"><strong>分塊預填充尺寸 (Chunked Prefill Size)</strong></td>
<td style="text-align:left"><code>2048</code> tokens</td>
<td style="text-align:left">抑制 FP4 indexer attention logits 峰值張量至 2.0 GB，徹底消除超長上下文 OOM</td>
</tr>
<tr>
<td style="text-align:left"><strong>快取釋放頻率</strong></td>
<td style="text-align:left"><code>2048</code> tokens</td>
<td style="text-align:left"><code>DSV41_PREFILL_EMPTY_CACHE_TOKENS=2048</code>，每分塊預填充後立即主動釋放記憶體片段</td>
</tr>
<tr>
<td style="text-align:left"><strong>推測解碼 (Speculative Decoding)</strong></td>
<td style="text-align:left">DSpark (Block Size = 5)</td>
<td style="text-align:left">草稿模型 <code>DeepseekV4ForCausalLMDSpark</code> 圖融合加速，動態接受率 ~0.44</td>
</tr>
<tr>
<td style="text-align:left"><strong>Engram Offload</strong></td>
<td style="text-align:left">本地 NVMe 卸載</td>
<td style="text-align:left">Layer 1 與 Layer 14 各 ~24 GiB，96 I/O threads 直讀，完全不佔用主機 RAM 與網路頻寬</td>
</tr>
<tr>
<td style="text-align:left"><strong>多模態視覺 (Vision)</strong></td>
<td style="text-align:left">原生支援 (Triton Backend)</td>
<td style="text-align:left">支援 3024×588 高解析度影像，標準消耗 1024 視覺 tokens</td>
</tr>
<tr>
<td style="text-align:left"><strong>健康檢查機制</strong></td>
<td style="text-align:left"><code>SGLANG_ENABLE_HEALTH_ENDPOINT_GENERATION=0</code></td>
<td style="text-align:left"><code>/health</code> 即時回應 HTTP 200，杜絕長文本 Prefill 期間 dummy generation 造成的假死誤判</td>
</tr>
</tbody>
</table>
<hr />
<h2>三、 驗證與測試數據 (Verification &amp; Benchmark Data)</h2>
<h3>1. 基礎功能與能力驗證 (Correctness &amp; Advanced Capabilities)</h3>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th style="text-align:left">測試項目</th>
<th style="text-align:left">輸入條件</th>
<th style="text-align:left">輸出結果 / 指標</th>
<th style="text-align:left">狀態</th>
</tr>
</thead>
<tbody>
<tr>
<td style="text-align:left"><strong>算術邏輯 (Arithmetic)</strong></td>
<td style="text-align:left"><code>19 + 23</code></td>
<td style="text-align:left">輸出 <code>42</code>，延遲 0.32s</td>
<td style="text-align:left"><strong>通過 (PASSED)</strong></td>
</tr>
<tr>
<td style="text-align:left"><strong>代碼生成 (Code Generation)</strong></td>
<td style="text-align:left">快速逆平方根 (Fast Inverse Square Root)</td>
<td style="text-align:left">輸出完整包含 <code>0x5f3759df</code> 與牛頓迭代之代碼，解碼速率 <strong>39.2 tok/s</strong></td>
<td style="text-align:left"><strong>通過 (PASSED)</strong></td>
</tr>
<tr>
<td style="text-align:left"><strong>結構化輸出 (JSON Schema)</strong></td>
<td style="text-align:left">巴黎景點資料 Strict JSON Schema</td>
<td style="text-align:left">100% 吻合 Schema 定義，延遲 1.19s</td>
<td style="text-align:left"><strong>通過 (PASSED)</strong></td>
</tr>
<tr>
<td style="text-align:left"><strong>思考切換 (Thinking OFF)</strong></td>
<td style="text-align:left">質數判定直接回答</td>
<td style="text-align:left">直接回覆 <code>Yes</code>，無思考內容，延遲 0.29s</td>
<td style="text-align:left"><strong>通過 (PASSED)</strong></td>
</tr>
<tr>
<td style="text-align:left"><strong>深度思考 (Thinking ON)</strong></td>
<td style="text-align:left">質數判定逐步推演</td>
<td style="text-align:left">產出 1,536 字元之完整數學證明思維鏈，延遲 12.05s</td>
<td style="text-align:left"><strong>通過 (PASSED)</strong></td>
</tr>
<tr>
<td style="text-align:left"><strong>工具呼叫 (Tool Calling)</strong></td>
<td style="text-align:left"><code>get_stock_price(NVDA)</code></td>
<td style="text-align:left">正確發起 Tool Call 參數並於次輪整合回傳股價，總延遲 2.21s</td>
<td style="text-align:left"><strong>通過 (PASSED)</strong></td>
</tr>
<tr>
<td style="text-align:left"><strong>原生視覺 (Multimodal Vision)</strong></td>
<td style="text-align:left">3024×588 幾何彩色圖形</td>
<td style="text-align:left">精準識別紅圓與藍方之相對位置，消耗 1024 vision tokens，延遲 2.07s</td>
<td style="text-align:left"><strong>通過 (PASSED)</strong></td>
</tr>
</tbody>
</table>
<hr />
<h3>2. 長上下文階梯壓測 (Long-Context Benchmark)</h3>
<p dir="auto">依據生產反向代理（Proxy）預設上限 500K，測試數據如下：</p>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th style="text-align:left">測試長度 (Tokens)</th>
<th style="text-align:left">首字延遲 (TTFT)</th>
<th style="text-align:left">Prefill 吞吐速率</th>
<th style="text-align:left">輸出 Tokens</th>
<th style="text-align:left">解碼延遲</th>
<th style="text-align:left">解碼速率</th>
<th style="text-align:left">總耗時 (Wall Time)</th>
<th style="text-align:left">輸出品質</th>
<th style="text-align:left">狀態</th>
</tr>
</thead>
<tbody>
<tr>
<td style="text-align:left"><strong>32K</strong> (32,768)</td>
<td style="text-align:left"><strong>10.02s</strong></td>
<td style="text-align:left"><strong>3,271.0 tok/s</strong></td>
<td style="text-align:left">64</td>
<td style="text-align:left">0.95s</td>
<td style="text-align:left"><strong>67.5 tok/s</strong></td>
<td style="text-align:left">14.44s</td>
<td style="text-align:left">技術摘要精準連貫</td>
<td style="text-align:left"><strong>PASSED</strong></td>
</tr>
<tr>
<td style="text-align:left"><strong>128K</strong> (131,072)</td>
<td style="text-align:left"><strong>48.46s</strong></td>
<td style="text-align:left"><strong>2,704.8 tok/s</strong></td>
<td style="text-align:left">64</td>
<td style="text-align:left">0.95s</td>
<td style="text-align:left"><strong>67.5 tok/s</strong></td>
<td style="text-align:left">48.94s</td>
<td style="text-align:left">技術摘要精準連貫</td>
<td style="text-align:left"><strong>PASSED</strong></td>
</tr>
<tr>
<td style="text-align:left"><strong>256K</strong> (262,144)</td>
<td style="text-align:left"><strong>87.46s</strong></td>
<td style="text-align:left"><strong>2,997.3 tok/s</strong></td>
<td style="text-align:left">64</td>
<td style="text-align:left">1.08s</td>
<td style="text-align:left"><strong>59.4 tok/s</strong></td>
<td style="text-align:left">88.00s</td>
<td style="text-align:left">技術摘要精準連貫</td>
<td style="text-align:left"><strong>PASSED</strong></td>
</tr>
<tr>
<td style="text-align:left"><strong>500K</strong> (500,000)</td>
<td style="text-align:left"><strong>268.94s</strong></td>
<td style="text-align:left"><strong>1,859.1 tok/s</strong></td>
<td style="text-align:left">64</td>
<td style="text-align:left">1.10s</td>
<td style="text-align:left"><strong>58.2 tok/s</strong></td>
<td style="text-align:left">269.49s</td>
<td style="text-align:left">技術摘要精準連貫</td>
<td style="text-align:left"><strong>PASSED</strong></td>
</tr>
</tbody>
</table>
<blockquote>
<p dir="auto"><strong>記憶體監控結果</strong>：在 500K 超長上下文推演期間，各節點 GB10 實體可用記憶體均保持在 18 ~ 20 GiB，Swap 使用量全程維持 <strong>0 bytes</strong>，無任何 OOM 或快取逐出情況。</p>
</blockquote>
<hr />
<h3>3. 高並發壓測 (Concurrency Benchmark C1 → C8)</h3>
<p dir="auto">測試梯級涵蓋 C1 至滿載 C8 並行請求，每請求生成 128 output tokens：</p>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th style="text-align:left">並發等級</th>
<th style="text-align:left">成功率</th>
<th style="text-align:left">總耗時 (Wall Time)</th>
<th style="text-align:left">總生成 Tokens</th>
<th style="text-align:left">聚合吞吐速率</th>
<th style="text-align:left">平均請求延遲</th>
<th style="text-align:left">P50 延遲</th>
<th style="text-align:left">P95 延遲</th>
<th style="text-align:left">狀態</th>
</tr>
</thead>
<tbody>
<tr>
<td style="text-align:left"><strong>C1</strong> (1 並行)</td>
<td style="text-align:left">1/1 (100%)</td>
<td style="text-align:left">3.47s</td>
<td style="text-align:left">128</td>
<td style="text-align:left"><strong>36.9 tok/s</strong></td>
<td style="text-align:left">3.47s</td>
<td style="text-align:left">3.47s</td>
<td style="text-align:left">3.47s</td>
<td style="text-align:left"><strong>PASSED</strong></td>
</tr>
<tr>
<td style="text-align:left"><strong>C2</strong> (2 並行)</td>
<td style="text-align:left">2/2 (100%)</td>
<td style="text-align:left">5.13s</td>
<td style="text-align:left">256</td>
<td style="text-align:left"><strong>49.9 tok/s</strong></td>
<td style="text-align:left">5.05s</td>
<td style="text-align:left">5.05s</td>
<td style="text-align:left">5.12s</td>
<td style="text-align:left"><strong>PASSED</strong></td>
</tr>
<tr>
<td style="text-align:left"><strong>C4</strong> (4 並行)</td>
<td style="text-align:left">4/4 (100%)</td>
<td style="text-align:left">6.72s</td>
<td style="text-align:left">512</td>
<td style="text-align:left"><strong>76.2 tok/s</strong></td>
<td style="text-align:left">6.45s</td>
<td style="text-align:left">6.47s</td>
<td style="text-align:left">6.72s</td>
<td style="text-align:left"><strong>PASSED</strong></td>
</tr>
<tr>
<td style="text-align:left"><strong>C6</strong> (6 並行)</td>
<td style="text-align:left">6/6 (100%)</td>
<td style="text-align:left">8.27s</td>
<td style="text-align:left">768</td>
<td style="text-align:left"><strong>92.8 tok/s</strong></td>
<td style="text-align:left">7.59s</td>
<td style="text-align:left">7.86s</td>
<td style="text-align:left">8.27s</td>
<td style="text-align:left"><strong>PASSED</strong></td>
</tr>
<tr>
<td style="text-align:left"><strong>C8</strong> (8 並行)</td>
<td style="text-align:left">8/8 (100%)</td>
<td style="text-align:left">10.67s</td>
<td style="text-align:left">1024</td>
<td style="text-align:left"><strong>96.0 tok/s</strong></td>
<td style="text-align:left">8.51s</td>
<td style="text-align:left">8.50s</td>
<td style="text-align:left">10.66s</td>
<td style="text-align:left"><strong>PASSED</strong></td>
</tr>
</tbody>
</table>
<ul>
<li><strong>全數成功</strong>：21/21 個請求全部成功回傳（成功率 100%）。</li>
<li><strong>極速解碼</strong>：滿載 8 並發下，聚合輸出速率達到 <strong>96.0 tok/s</strong>，P50 延遲僅 8.50s。</li>
<li><strong>動態排程</strong>：SGLang 與 CUDA Graph 完美覆蓋動態批次，無重新分配與記憶體震盪。</li>
</ul>
<hr />
]]></description><link>https://lcz.me/topic/1658</link><generator>RSS for Node</generator><lastBuildDate>Sun, 13 Sep 2026 17:39:35 GMT</lastBuildDate><atom:link href="https://lcz.me/topic/1658.rss" rel="self" type="application/rss+xml"/><pubDate>Sat, 12 Sep 2026 15:19:03 GMT</pubDate><ttl>60</ttl><item><title><![CDATA[Reply to Deepseek v4.1 flash , 4台DGX spark GB10, TP=4 on Sat, 12 Sep 2026 22:12:05 GMT]]></title><description><![CDATA[<blockquote>
<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/soop-ladios" aria-label="Profile: soop-ladios">@<bdi>soop-ladios</bdi></a> <a href="/post/17601">said</a>:</p>
<p dir="auto">三條約50-100 tok/s. prefill速度在2500 ~ 3000 tok/s左右</p>
</blockquote>
<p dir="auto">要推動這麼大的參數巨獸 真是不容易, 家用 Deepseek v4.1 flash</p>
]]></description><link>https://lcz.me/post/17672</link><guid isPermaLink="true">https://lcz.me/post/17672</guid><dc:creator><![CDATA[kos or]]></dc:creator><pubDate>Sat, 12 Sep 2026 22:12:05 GMT</pubDate></item><item><title><![CDATA[Reply to Deepseek v4.1 flash , 4台DGX spark GB10, TP=4 on Sat, 12 Sep 2026 16:31:35 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/benton-yi" aria-label="Profile: benton-yi">@<bdi>benton-yi</bdi></a><br />
我是沒試過, 不過實際上是可行的 , 可以參考 <a href="https://github.com/FujitsuPolycom/sparkring/blob/main/docs/DEEPSEEK_V41_FLASH_QUICKSTART.md" rel="nofollow ugc">https://github.com/FujitsuPolycom/sparkring/blob/main/docs/DEEPSEEK_V41_FLASH_QUICKSTART.md</a><br />
作者已經跑通很多模型, 數據跟接switch相比也不見得慢.<br />
根據作者自述, 多跳一個節點損耗並不大, 每台DGX spark GB10有兩個port, 組四台ring最多也就跳一次, 應該在可接受範圍內.<br />
底下原作者說的:<br />
64 KiB<br />
直接 RDMA DAC 電纜 8.65 µs 節點 <img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2194.png?v=a9f01d9edaa" class="not-responsive emoji emoji-android emoji--left_right_arrow" style="height:23px;width:auto;vertical-align:middle" title="↔" alt="↔" /> 節點 1<br />
VirtualDiagonalMesh 10.51 µs 節點 <img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2194.png?v=a9f01d9edaa" class="not-responsive emoji emoji-android emoji--left_right_arrow" style="height:23px;width:auto;vertical-align:middle" title="↔" alt="↔" /> 節點 1 <img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2194.png?v=a9f01d9edaa" class="not-responsive emoji emoji-android emoji--left_right_arrow" style="height:23px;width:auto;vertical-align:middle" title="↔" alt="↔" /> 節點 2</p>
<p dir="auto">同樣的數據，從 64 KiB 到 2 MiB，平均每次傳輸延遲增加 1.78 µs。頻寬保持不變，損耗極小。</p>
<p dir="auto">另外, 這四台我接的是100G的線, 因為現在switch不好買. 如果用200G, CRS804只能接8台, 100G可以接16台. 實際量測各個模型的使用頻寬, 不管是TP=4還是TP=8, 流量很少超過50G. 所以其實買100G的CRS504也是可以的.</p>
]]></description><link>https://lcz.me/post/17624</link><guid isPermaLink="true">https://lcz.me/post/17624</guid><dc:creator><![CDATA[soop ladios]]></dc:creator><pubDate>Sat, 12 Sep 2026 16:31:35 GMT</pubDate></item><item><title><![CDATA[Reply to Deepseek v4.1 flash , 4台DGX spark GB10, TP=4 on Sat, 12 Sep 2026 16:03:04 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/benton-yi" aria-label="Profile: benton-yi">@<bdi>benton-yi</bdi></a> TP4 的核心约束不是"能不能连上"，是 all-reduce 的延迟。transformer 每层、每 token 都要 all-reduce，链路延迟直接乘进 decode。</p>
<p dir="auto">不用交换机的环（daisy-chain）NCCL 能识别，但 4 节点环上 all-reduce 的通信步数是 2(N-1)=6 跳，延迟明显高于全互联；而且中间任一节点/线缆出问题，整环降速甚至挂掉。CX-7 是 200G 级，带宽不是瓶颈，问题在拓扑跳数和故障域。</p>
<p dir="auto">建议：</p>
<ul>
<li>本地验证/学习：环可以跑，先上 nccl-tests 的 all_reduce_perf，量 busbw 和延迟，再决定要不要跑 vLLM。</li>
<li>生产 TP4：上 200G 交换机做全互联，或确认板载双口能两两直连组全互联。</li>
<li>顺便确认 vLLM 的 TP 通信切分和 overlap，长 prompt prefill 最容易被通信拖。</li>
</ul>
<p dir="auto">先量延迟，再定拓扑，别先买交换机。</p>
]]></description><link>https://lcz.me/post/17617</link><guid isPermaLink="true">https://lcz.me/post/17617</guid><dc:creator><![CDATA[Xiaote]]></dc:creator><pubDate>Sat, 12 Sep 2026 16:03:04 GMT</pubDate></item><item><title><![CDATA[Reply to Deepseek v4.1 flash , 4台DGX spark GB10, TP=4 on Sat, 12 Sep 2026 15:47:35 GMT]]></title><description><![CDATA[<p dir="auto">想了解一下DSV4.1的TP4必须要通过交换机方式组网吗？如果4个节点不使用交换机，采用环形网络拓扑（对面节点无法直接访问）方式可以做到吗？</p>
]]></description><link>https://lcz.me/post/17610</link><guid isPermaLink="true">https://lcz.me/post/17610</guid><dc:creator><![CDATA[benton yi]]></dc:creator><pubDate>Sat, 12 Sep 2026 15:47:35 GMT</pubDate></item><item><title><![CDATA[Reply to Deepseek v4.1 flash , 4台DGX spark GB10, TP=4 on Sat, 12 Sep 2026 15:33:39 GMT]]></title><description><![CDATA[<p dir="auto">这么快就来了， 火钳流明</p>
]]></description><link>https://lcz.me/post/17605</link><guid isPermaLink="true">https://lcz.me/post/17605</guid><dc:creator><![CDATA[johnnybegood]]></dc:creator><pubDate>Sat, 12 Sep 2026 15:33:39 GMT</pubDate></item><item><title><![CDATA[Reply to Deepseek v4.1 flash , 4台DGX spark GB10, TP=4 on Sat, 12 Sep 2026 15:26:58 GMT]]></title><description><![CDATA[<p dir="auto">好文，謝謝無私分享</p>
]]></description><link>https://lcz.me/post/17604</link><guid isPermaLink="true">https://lcz.me/post/17604</guid><dc:creator><![CDATA[CHIA AN YANG]]></dc:creator><pubDate>Sat, 12 Sep 2026 15:26:58 GMT</pubDate></item></channel></rss>