<?xml version="1.0" encoding="UTF-8"?><rss xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title><![CDATA[SGLang HiCache 三层 KV 缓存实测：4090 48G 单卡跑通 Qwen3.8-27B 去审（256K + MTP + 视觉全占）]]></title><description><![CDATA[<h1>SGLang HiCache 三层 KV 缓存实测：4090 48G 单卡跑通 Qwen3.8-27B 去审（256K + MTP + 视觉全占）</h1>
<p dir="auto">看到坛里 32G Blackwell 用三层 KV 缓存跑 Qwen3.8-27B 的帖子，分享下我这边 4090 48G 的实测。48G 的余量正好把 <strong>MTP 投机 + HiCache 多会话复用 + 满 256K 上下文 + 去审</strong> 四样同时占全，不用二选一。已稳定跑生产十来天。</p>
<h2>用途 / 工作流</h2>
<p dir="auto">这台 4090 上的去审大模型是整条视频生产线的<strong>大脑</strong>：</p>
<ul>
<li><strong>输入</strong>：黄易武侠小说《寻秦记》原文</li>
<li><strong>4090（本机）</strong>：去审 Qwen3.8-27B 作为 agent，读小说→按叙述句细拆分镜→生成每段画面的提示词与音画同步脚本</li>
<li><strong>4080 32G</strong>：跑 ComfyUI 的 <strong>MiniMax H3 去审工作流</strong>，按 4090 给的分镜逐段出视频</li>
<li>简言之：<strong>4090 指挥、4080 出片</strong>，全流程去审、长上下文（整部小说 + 分镜历史）常驻</li>
</ul>
<p dir="auto">正因为反复处理<strong>同一部小说的长上下文</strong>（大量共享前缀），HiCache 的前缀复用命中率才高得离谱（见下）。</p>
<h2>硬件 &amp; 模型</h2>
<ul>
<li><strong>GPU</strong>：RTX 4090 48GB（Ada 魔改，1008 GB/s）</li>
<li><strong>主机</strong>：Ubuntu，系统内存 62GB</li>
<li><strong>模型</strong>：Qwen3.8-27B-HERETIC 去审版 · FP8（compressed-tensors，~30GB）</li>
<li><strong>HuggingFace</strong>：<a href="https://huggingface.co/OptimizeLLM/Qwen3.8-27B-heretic-MTP-FP8" rel="nofollow ugc">https://huggingface.co/OptimizeLLM/Qwen3.8-27B-heretic-MTP-FP8</a></li>
<li><strong>架构</strong>：Dense 稠密（非 MoE）+ 混合注意力（48 linear/GDN + 16 full）+ 原生视觉 VL</li>
<li><strong>引擎</strong>：SGLang 0.5.17</li>
</ul>
<h2>HiCache 三层 KV 缓存</h2>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>层</th>
<th>内容</th>
<th>容量</th>
</tr>
</thead>
<tbody>
<tr>
<td><strong>L1 GPU（热）</strong></td>
<td>fp8 KV，显存</td>
<td>270,278 token（~8.6G）</td>
</tr>
<tr>
<td><strong>L2 主机内存（温）</strong></td>
<td><code>--hicache-size 24</code></td>
<td>504,447 token（24G）</td>
</tr>
<tr>
<td><strong>L3 NVMe（冷）</strong></td>
<td>未启用（纯内存，足够用）</td>
<td>—</td>
</tr>
</tbody>
</table>
<ul>
<li>上下文窗口：<strong>256K</strong>（<code>--context-length 262144</code>），KV 池 270K 保满 262K 有余</li>
<li>写策略：<code>write_through</code>；io-backend <code>kernel</code> + mem-layout <code>page_first</code></li>
</ul>
<h2>性能实测</h2>
<ul>
<li><strong>吞吐</strong>：thinking-off ~63–76 tok/s（峰 76）；thinking-on ~35–47 tok/s</li>
<li><strong>MTP 投机</strong>：链式 NEXTN 工作正常，accept len 3.8–4.2（no_think）</li>
<li><strong>前缀缓存命中率</strong>：<strong>~88.5%</strong>（累计 prompt 3000 万+ token，命中占八九成）</li>
<li><strong>L2 内存池</strong>：503,430 / 504,447 ≈ <strong>99.8% 满</strong>（小说前缀被反复复用，LRU 淘汰）</li>
<li><strong>前缀复用提速</strong>：命中时首 token 冷 2.6s → 暖 0.67s（<strong>快 ~75%</strong>），17 万 token 长前缀单次直接命中免重算</li>
</ul>
<h2>稳定性 / 运行时长</h2>
<ul>
<li><strong>当前配置（去审 FP8 + hicache 24G）</strong>：连续 ~20 小时零崩溃，已服务 3000 万+ token</li>
<li><strong>去审 Qwen3.8 生产线</strong>：~11 天，端点对各 agent 一直在线</li>
<li><strong>主机连续开机</strong>：2 周 4 天</li>
</ul>
<h2>启动参数</h2>
<pre><code class="language-bash">python -m sglang.launch_server \
  --model-path /data/qwen3.8-27b-heretic-fp8 --served-model-name 4090 --host 0.0.0.0 --port 8001 \
  --context-length 262144 --max-running-requests 1 --mem-fraction-static 0.98 \
  --kv-cache-dtype fp8_e4m3 \
  --speculative-algorithm NEXTN --speculative-eagle-topk 1 --speculative-num-steps 5 --speculative-num-draft-tokens 6 \
  --enable-hierarchical-cache --hicache-size 24 --hicache-write-policy write_through \
  --reasoning-parser qwen3 --tool-call-parser qwen3_coder --trust-remote-code --sleep-on-idle
</code></pre>
<h2>几个踩坑 / 权衡</h2>
<ol>
<li><strong>HiCache 的真正价值是「多会话 KV 复用免 prefill」，不是跑更大上下文</strong>——我这种「反复喂同一部小说」的场景命中率 88.5%，省掉八九成重复 prefill，指挥出片的节奏快很多。</li>
<li><strong>FP8 权重大（30G）→ 树形投机与满 256K 不可兼得</strong>：所以用链式 NEXTN（<code>topk1/steps5/draft6</code>），保满 262K；想上树形投机就得牺牲上下文。</li>
<li><strong><code>--page-size</code> 必须为 1</strong>：page-size 64 与混合 mamba 模型 + hicache 不兼容，会 <strong>Segmentation fault 崩溃</strong>，别踩。</li>
<li><strong>内存成本</strong>：hicache 24G 常驻内存，多卡各开一份会把内存吃紧（我这边 4090 指挥 + 4080 出片同时跑，62G 内存 + swap 就满了），按机器内存量力而行。</li>
</ol>
<h2>小结</h2>
<p dir="auto">一台 4090 48G 当「导演」（去审长上下文 agent 读小说、拆分镜），一台 4080 32G 当「摄制组」（ComfyUI MiniMax H3 去审工作流出片）。4090 相比 32G 卡的最大不同：<strong>不用在速度（MTP）和会话持久（HiCache）之间二选一</strong>，还能同时保满 256K + 去审。三层 KV 缓存实测命中 ~88.5%，稳定跑生产已 ~11 天。同样搞长篇小说转视频的欢迎交流。</p>
]]></description><link>https://lcz.me/topic/1356</link><generator>RSS for Node</generator><lastBuildDate>Wed, 09 Sep 2026 22:53:38 GMT</lastBuildDate><atom:link href="https://lcz.me/topic/1356.rss" rel="self" type="application/rss+xml"/><pubDate>Thu, 27 Aug 2026 09:20:33 GMT</pubDate><ttl>60</ttl><item><title><![CDATA[Reply to SGLang HiCache 三层 KV 缓存实测：4090 48G 单卡跑通 Qwen3.8-27B 去审（256K + MTP + 视觉全占） on Wed, 09 Sep 2026 11:00:09 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/%E7%94%A8%E6%88%B7%E5%90%8D%E8%BF%9D%E8%A7%84" aria-label="Profile: 用户名违规">@<bdi>用户名违规</bdi></a> 0.98确实太激进了，我现在改成0.96，上下文224K。</p>
]]></description><link>https://lcz.me/post/16878</link><guid isPermaLink="true">https://lcz.me/post/16878</guid><dc:creator><![CDATA[Michael Zhou]]></dc:creator><pubDate>Wed, 09 Sep 2026 11:00:09 GMT</pubDate></item><item><title><![CDATA[Reply to SGLang HiCache 三层 KV 缓存实测：4090 48G 单卡跑通 Qwen3.8-27B 去审（256K + MTP + 视觉全占） on Fri, 04 Sep 2026 16:06:05 GMT]]></title><description><![CDATA[<p dir="auto">0.98 不是"只留 2% 给 GEMM"，这里有个常见误解：SGLang 的 mem-fraction-static 是对<strong>权重占完以后剩下的显存</strong>再切池子——权重（FP8 约 30GB）是加载时单独占的，不在这 2% 里；GEMM/激活用的是瞬时 workspace，不需要预留给一整块。所以单并发 0.98 稳是正常的，不是运气。</p>
<p dir="auto">双并发崩的原因也大概率不是"KV 池不够"——HiCache 池满了会 spill 到内存/SSD（L2/L3 就是干这个的），不该崩。真正吃余量的是<strong>每路并发请求的 CUDA graph buffer + 激活 workspace</strong>：SGLang 按请求形状捕获 graph，池子顶到 0.98 后没有空闲头寸给第二路，graph 捕获/分配失败就直接崩。而且楼主这条命令本来就写着 --max-running-requests 1，意思是按单路并发调的池子，你硬开双并发属于超设计运行。</p>
<p dir="auto">对照实验站里就有：TID:1502 starryskyknight 双 3090 实测，mem-fraction 0.94 时 draft 的 CUDA graph 起不来，降到 0.90 立刻正常（并发冲到 249 t/s）。你从 0.98 降到 0.90~0.92 再开双并发试试，KV 池少的那点（HiCache 有 L2/L3 兜底）可以忽略；要是还崩，翻 sglang 日志找 "cuda graph capture failed" 或 "CUDA OOM" 关键字，能直接定位是不是 graph 头寸的问题。</p>
]]></description><link>https://lcz.me/post/15876</link><guid isPermaLink="true">https://lcz.me/post/15876</guid><dc:creator><![CDATA[Xiaote]]></dc:creator><pubDate>Fri, 04 Sep 2026 16:06:05 GMT</pubDate></item><item><title><![CDATA[Reply to SGLang HiCache 三层 KV 缓存实测：4090 48G 单卡跑通 Qwen3.8-27B 去审（256K + MTP + 视觉全占） on Fri, 04 Sep 2026 14:45:50 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/leon-y" aria-label="Profile: Leon-Y">@<bdi>Leon-Y</bdi></a> 我还看大唐双龙传呢</p>
]]></description><link>https://lcz.me/post/15870</link><guid isPermaLink="true">https://lcz.me/post/15870</guid><dc:creator><![CDATA[johnnybegood]]></dc:creator><pubDate>Fri, 04 Sep 2026 14:45:50 GMT</pubDate></item><item><title><![CDATA[Reply to SGLang HiCache 三层 KV 缓存实测：4090 48G 单卡跑通 Qwen3.8-27B 去审（256K + MTP + 视觉全占） on Fri, 04 Sep 2026 14:09:21 GMT]]></title><description><![CDATA[<p dir="auto">48G有问题呀，0.98 ，留给GEMM只有2%不会触发OOM？这都能稳定？唯一这里是单并发，我开双并发就用以崩。。难受。</p>
]]></description><link>https://lcz.me/post/15866</link><guid isPermaLink="true">https://lcz.me/post/15866</guid><dc:creator><![CDATA[用户名违规]]></dc:creator><pubDate>Fri, 04 Sep 2026 14:09:21 GMT</pubDate></item><item><title><![CDATA[Reply to SGLang HiCache 三层 KV 缓存实测：4090 48G 单卡跑通 Qwen3.8-27B 去审（256K + MTP + 视觉全占） on Fri, 28 Aug 2026 09:10:54 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/chia-an-yang" aria-label="Profile: CHIA-AN-YANG">@<bdi>CHIA-AN-YANG</bdi></a> 生产出来的视频片段质量非常不稳定，片段之间人物面孔没办法保持一致，等我生产好了发给你鉴赏。</p>
]]></description><link>https://lcz.me/post/14590</link><guid isPermaLink="true">https://lcz.me/post/14590</guid><dc:creator><![CDATA[Michael Zhou]]></dc:creator><pubDate>Fri, 28 Aug 2026 09:10:54 GMT</pubDate></item><item><title><![CDATA[Reply to SGLang HiCache 三层 KV 缓存实测：4090 48G 单卡跑通 Qwen3.8-27B 去审（256K + MTP + 视觉全占） on Fri, 28 Aug 2026 05:45:52 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/leon-y" aria-label="Profile: Leon-Y">@<bdi>Leon-Y</bdi></a> 你不老啊，大家只是怕暴露年龄。</p>
]]></description><link>https://lcz.me/post/14544</link><guid isPermaLink="true">https://lcz.me/post/14544</guid><dc:creator><![CDATA[terry]]></dc:creator><pubDate>Fri, 28 Aug 2026 05:45:52 GMT</pubDate></item><item><title><![CDATA[Reply to SGLang HiCache 三层 KV 缓存实测：4090 48G 单卡跑通 Qwen3.8-27B 去审（256K + MTP + 视觉全占） on Fri, 28 Aug 2026 01:47:02 GMT]]></title><description><![CDATA[<p dir="auto">黄易的《寻秦记》小说, 穿越小说的开山鼻祖，有人没看过么？<br />
还是我太老？</p>
]]></description><link>https://lcz.me/post/14486</link><guid isPermaLink="true">https://lcz.me/post/14486</guid><dc:creator><![CDATA[Leon Y]]></dc:creator><pubDate>Fri, 28 Aug 2026 01:47:02 GMT</pubDate></item><item><title><![CDATA[Reply to SGLang HiCache 三层 KV 缓存实测：4090 48G 单卡跑通 Qwen3.8-27B 去审（256K + MTP + 视觉全占） on Thu, 27 Aug 2026 23:13:43 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/michael-zhou" aria-label="Profile: Michael-Zhou">@<bdi>Michael-Zhou</bdi></a> 有影片看看嗎？哈<br />
非常好奇</p>
]]></description><link>https://lcz.me/post/14468</link><guid isPermaLink="true">https://lcz.me/post/14468</guid><dc:creator><![CDATA[CHIA AN YANG]]></dc:creator><pubDate>Thu, 27 Aug 2026 23:13:43 GMT</pubDate></item><item><title><![CDATA[Reply to SGLang HiCache 三层 KV 缓存实测：4090 48G 单卡跑通 Qwen3.8-27B 去审（256K + MTP + 视觉全占） on Thu, 27 Aug 2026 17:06:25 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/zhenyu-huang" aria-label="Profile: zhenyu-huang">@<bdi>zhenyu-huang</bdi></a><br />
我把YouTube上做AI视频的视频教程链接发给他，让他自己下载视频，然后每秒截一帧，自己识别图片学习。<br />
并且让他下载教程的音频，让他把音频转成文字，学习教程文字内容。<br />
奇怪，没有人好奇黄易的《寻秦记》小说写的是什么吗？这个才是重点^-^</p>
]]></description><link>https://lcz.me/post/14458</link><guid isPermaLink="true">https://lcz.me/post/14458</guid><dc:creator><![CDATA[Michael Zhou]]></dc:creator><pubDate>Thu, 27 Aug 2026 17:06:25 GMT</pubDate></item><item><title><![CDATA[Reply to SGLang HiCache 三层 KV 缓存实测：4090 48G 单卡跑通 Qwen3.8-27B 去审（256K + MTP + 视觉全占） on Thu, 27 Aug 2026 16:40:28 GMT]]></title><description><![CDATA[<p dir="auto">不明觉厉 我比较好奇的是你拆镜头的提示词是怎么实现的</p>
]]></description><link>https://lcz.me/post/14456</link><guid isPermaLink="true">https://lcz.me/post/14456</guid><dc:creator><![CDATA[zhenyu huang]]></dc:creator><pubDate>Thu, 27 Aug 2026 16:40:28 GMT</pubDate></item></channel></rss>