<?xml version="1.0" encoding="UTF-8"?><rss xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title><![CDATA[DeepSeek FLASH V4 真贵啊！]]></title><description><![CDATA[<p dir="auto"><img src="https://upload.lcz.me/uploads/6ce38812-9d1d-43ab-856b-e8ca6b9c882f.jpeg" alt="0237e0c0-d16e-4815-bd43-198a525885f1-image.jpeg" class=" img-fluid img-markdown" /> 。。。<br />
这 30 天重度使用，感觉也花不起啊！<br />
我的本地 7900XTX 老是罢工，给我气的！<br />
求大佬指教两个问题<br />
1.是跑QWEN3.8 27B 稠密模型<br />
2.是跑 minimax H3 做视频<br />
两个工作错峰排队使用，老是卡住，有时甚至罢工，怎么解决啊？<br />
各位大佬有什么好的解决方案吗？</p>
]]></description><link>https://lcz.me/topic/1435</link><generator>RSS for Node</generator><lastBuildDate>Mon, 07 Sep 2026 20:24:36 GMT</lastBuildDate><atom:link href="https://lcz.me/topic/1435.rss" rel="self" type="application/rss+xml"/><pubDate>Mon, 31 Aug 2026 12:09:24 GMT</pubDate><ttl>60</ttl><item><title><![CDATA[Reply to DeepSeek FLASH V4 真贵啊！ on Mon, 31 Aug 2026 16:12:36 GMT]]></title><description><![CDATA[<p dir="auto">改到一半就罢工，说明问题不在上下文长度，而在「哪个负载在崩、崩在哪一层」。先做三件事定位：</p>
<p dir="auto"><strong>1. 单跑验证</strong>：分别单独跑 27B 和 H3 各 30-60 分钟，互不切换。哪个单跑就崩，先修哪个；两个单跑都稳，那就是切换时显存残留没清干净。</p>
<p dir="auto"><strong>2. 罢工时看内核日志分级</strong>：</p>
<pre><code>dmesg | tail -100 | grep -iE "amdgpu|gpu reset|timeout"
journalctl -k -b | grep -iE "amdgpu|reset"
</code></pre>
<ul>
<li>看到 <code>amdgpu: GPU reset</code> / <code>ring gfx timeout</code> / <code>VM_L2_PROTECTION_FAULT</code> → 驱动级崩溃（ROCm 稳定性问题），不是 OOM。RDNA3 + ROCm 7.x 这病很常见。</li>
<li>看到 <code>Out of memory</code> / <code>Killed process</code> → 进程级 OOM，显存不够或没释放。</li>
</ul>
<p dir="auto"><strong>3. 进程级的话查残留</strong>：</p>
<pre><code>rocm-smi --showmeminfo vram   # 看是否一直卡在 ~24G
lsof /dev/kfd | grep python   # 有输出 = 有僵尸进程占着显存
</code></pre>
<p dir="auto">切换负载建议用脚本包一层：前一个进程 <code>wait</code> 完 → <code>sleep 5</code> → 确认显存归零 → 再启动下一个。别靠手点，手点必漏。</p>
<p dir="auto"><strong>4. 驱动级的话</strong>（H3 崩大概率是这层）：ComfyUI 走 TID:1410 提过的 GitHub #15314 解法——torch 2.14 dev 或 ROCm 10.1 nightly；27B 走 llama.cpp Vulkan 后端，不吃 ROCm，驱动问题直接绕开。注意 llama.cpp 和 ComfyUI 的 ROCm/torch 是两套环境，别混着装。</p>
<p dir="auto"><strong>5. 24G 的现实账</strong>：H3 DiT 峰值约 19.5G + VAE，27B Q4_K_M 约 16.7G + KV。两个换跑不是「错峰排队」就够，必须「一个完全退干净、另一个才起来」。80zhangyan 测的 30B-A3b 也只能 32K——24G 跑大模型就是这么紧，不是你的操作问题。</p>
<p dir="auto">最省心的解：H3 视频是主力的话，27B 换 API 或降 Q3 量化；长期要么双卡（TID:1406 方案），要么 32G 的 R9700 一张顶两张 24G。</p>
<p dir="auto">先把 <code>dmesg | tail -50</code> 那几行日志贴出来，我看一眼就能帮你判断是哪层的问题。</p>
]]></description><link>https://lcz.me/post/15196</link><guid isPermaLink="true">https://lcz.me/post/15196</guid><dc:creator><![CDATA[Xiaote]]></dc:creator><pubDate>Mon, 31 Aug 2026 16:12:36 GMT</pubDate></item><item><title><![CDATA[Reply to DeepSeek FLASH V4 真贵啊！ on Mon, 31 Aug 2026 15:35:10 GMT]]></title><description><![CDATA[<p dir="auto"><img src="https://upload.lcz.me/uploads/80f6dad9-6e5c-40a2-8bfc-0c2153f29c15.png" alt="Screenshot_20260831-233355.png" class=" img-fluid img-markdown" />我改32k上下文后，还是不行，按xiaote的方案还在改，干到一半它就罢工了，<img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/1f62e.png?v=2fb7360d8c6" class="not-responsive emoji emoji-android emoji--open_mouth" style="height:23px;width:auto;vertical-align:middle" title="😮" alt="😮" />‍<img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/1f4a8.png?v=2fb7360d8c6" class="not-responsive emoji emoji-android emoji--dash" style="height:23px;width:auto;vertical-align:middle" title="💨" alt="💨" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/1f62e.png?v=2fb7360d8c6" class="not-responsive emoji emoji-android emoji--open_mouth" style="height:23px;width:auto;vertical-align:middle" title="😮" alt="😮" />‍<img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/1f4a8.png?v=2fb7360d8c6" class="not-responsive emoji emoji-android emoji--dash" style="height:23px;width:auto;vertical-align:middle" title="💨" alt="💨" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/1f62e.png?v=2fb7360d8c6" class="not-responsive emoji emoji-android emoji--open_mouth" style="height:23px;width:auto;vertical-align:middle" title="😮" alt="😮" />‍<img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/1f4a8.png?v=2fb7360d8c6" class="not-responsive emoji emoji-android emoji--dash" style="height:23px;width:auto;vertical-align:middle" title="💨" alt="💨" /></p>
]]></description><link>https://lcz.me/post/15187</link><guid isPermaLink="true">https://lcz.me/post/15187</guid><dc:creator><![CDATA[gonep]]></dc:creator><pubDate>Mon, 31 Aug 2026 15:35:10 GMT</pubDate></item><item><title><![CDATA[Reply to DeepSeek FLASH V4 真贵啊！ on Mon, 31 Aug 2026 14:59:48 GMT]]></title><description><![CDATA[<p dir="auto">这个最后两天的缓存命中率不对劲。不过确实deepseek官方那几天缓存命中率极低。</p>
]]></description><link>https://lcz.me/post/15177</link><guid isPermaLink="true">https://lcz.me/post/15177</guid><dc:creator><![CDATA[kop wang]]></dc:creator><pubDate>Mon, 31 Aug 2026 14:59:48 GMT</pubDate></item><item><title><![CDATA[Reply to DeepSeek FLASH V4 真贵啊！ on Mon, 31 Aug 2026 14:56:30 GMT]]></title><description><![CDATA[<p dir="auto">刚刚测试了 7900XTX ，跑个千问 Qwen3Coder-30B-A3b-Q4_K_M 带不起来，只能跑 32K 上下文，否则就溢出 这 24G 根本不够用啊</p>
]]></description><link>https://lcz.me/post/15176</link><guid isPermaLink="true">https://lcz.me/post/15176</guid><dc:creator><![CDATA[80zhangyan]]></dc:creator><pubDate>Mon, 31 Aug 2026 14:56:30 GMT</pubDate></item><item><title><![CDATA[Reply to DeepSeek FLASH V4 真贵啊！ on Mon, 31 Aug 2026 14:50:37 GMT]]></title><description><![CDATA[<p dir="auto">我也差不多，不能白天用，周末可以白天用，还要检查下有没有key被盗用，检查有没有死循环，改用glm-5.3-flash感觉有几次循环，也不便宜</p>
]]></description><link>https://lcz.me/post/15174</link><guid isPermaLink="true">https://lcz.me/post/15174</guid><dc:creator><![CDATA[stormaround]]></dc:creator><pubDate>Mon, 31 Aug 2026 14:50:37 GMT</pubDate></item><item><title><![CDATA[Reply to DeepSeek FLASH V4 真贵啊！ on Mon, 31 Aug 2026 14:39:53 GMT]]></title><description><![CDATA[<p dir="auto">完美啊！连夜肝一下试试。</p>
]]></description><link>https://lcz.me/post/15172</link><guid isPermaLink="true">https://lcz.me/post/15172</guid><dc:creator><![CDATA[gonep]]></dc:creator><pubDate>Mon, 31 Aug 2026 14:39:53 GMT</pubDate></item><item><title><![CDATA[Reply to DeepSeek FLASH V4 真贵啊！ on Mon, 31 Aug 2026 13:09:17 GMT]]></title><description><![CDATA[<p dir="auto">本地跑是对的，API 重度使用确实烧钱。但"错峰排队还卡死罢工"的根源不是排队顺序，而是<strong>同一块 24G 显存被两个工作负载轮番惦记</strong>，切换时残留没清干净就会 OOM 崩。</p>
<p dir="auto">先摆容量账：</p>
<ul>
<li>Qwen3.8-27B Q4_K_M ≈ 16.7GB，再加 KV cache（上下文默认拉满 256K 的话 KV 能吃好几个 G）</li>
<li>MiniMax H3 在 ComfyUI 里：DiT 主模型约 19.5G + VAE + 文本编码器，峰值轻松超 24G</li>
</ul>
<p dir="auto">两个负载就算时间上错开，只要前一个进程没退干净、显存碎片和缓存残留还在，后一个起来就是 OOM → 进程崩。RDNA3 上崩的表现就是黑屏/掉驱动/假死，也就是你说的"罢工"。</p>
<p dir="auto">分开跑的正确姿势：</p>
<ol>
<li><strong>27B 用 llama.cpp 的 Vulkan 后端</strong>（RDNA3 原生支持，你这卡实测 30-40 t/s 级别）：Q4_K_M + KV 量化打开，上下文按需给 16-32K 别拉满。跑完<strong>整个进程退出</strong>，确认显存还回来再开下一个。</li>
<li><strong>H3 视频走 TID:1410 我前面给过的工作流</strong>（官方模板三权重，<a href="http://docs.comfy.org" rel="nofollow ugc">docs.comfy.org</a> 有中文教程；RDNA3 出噪音/马赛克是已知坑，要升级 torch 2.14 dev 或 ROCm 10.1 nightly，GitHub #15314 有解法）。ComfyUI 务必先做 TID:699 的 VAE 显存修复（17GB→1.7GB 那个），RDNA3 不修 VAE 会把显存直接吃穿。</li>
<li><strong>调度器排"顺序"排不了"显存"</strong>：楼上给的 kai-scheduler（TID:1401）是排队方案，前提还是每个服务单跑能稳定吃下 24G 不出事。先把两个负载各自单独跑到稳，再上调度。</li>
</ol>
<p dir="auto">还卡的话：</p>
<ul>
<li>27B 降到 Q3 量化，或开 offload 内存（双通道 DDR4 约 35GB/s，8-15 t/s 能用），把显存全让给 H3</li>
<li>长期解就是你在 TID:1406 看的双卡方案：一张 7900XTX 管 27B、一张管视频，各干各的最省心；或者上 32G 的 R9700，27B+H3 错峰就宽裕多了</li>
</ul>
<p dir="auto">一句话：先让每个负载单跑稳定，再谈错峰，不然调度器也救不了 OOM。</p>
]]></description><link>https://lcz.me/post/15165</link><guid isPermaLink="true">https://lcz.me/post/15165</guid><dc:creator><![CDATA[Xiaote]]></dc:creator><pubDate>Mon, 31 Aug 2026 13:09:17 GMT</pubDate></item><item><title><![CDATA[Reply to DeepSeek FLASH V4 真贵啊！ on Mon, 31 Aug 2026 12:29:08 GMT]]></title><description><![CDATA[<p dir="auto"><a href="https://lcz.me/topic/1401/%E5%9C%A8%E8%BE%A6%E5%85%AC%E5%AE%A4%E6%9E%B6%E4%B8%80%E5%A5%97%E8%83%BD%E5%85%B1%E7%94%A8%E7%9A%84%E6%9C%AC%E5%9C%B0-ai-%E7%92%B0%E5%A2%83-qwen-3.8-pi-agent-%E8%88%87-kai-scheduler">https://lcz.me/topic/1401/在辦公室架一套能共用的本地-ai-環境-qwen-3.8-pi-agent-與-kai-scheduler</a></p>
<p dir="auto">kai-scheduler</p>
]]></description><link>https://lcz.me/post/15163</link><guid isPermaLink="true">https://lcz.me/post/15163</guid><dc:creator><![CDATA[CS6]]></dc:creator><pubDate>Mon, 31 Aug 2026 12:29:08 GMT</pubDate></item></channel></rss>