<?xml version="1.0" encoding="UTF-8"?><rss xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title><![CDATA[3090单卡跑qwen3.8 27b q4km 上下文2456K达成，但是感觉生产力还是不太行。]]></title><description><![CDATA[<p dir="auto">根据论坛上的大佬们的贴子，将我的3090跑起来了，小任务确实还能应付一下。<br />
<img src="https://upload.lcz.me/uploads/a713f74f-7f98-4dbc-8c41-45ee769356f7.jpeg" alt="517fe38b-2087-4b47-95e8-929aba36a565-bf026e0756d20f62fe00b35729c670c0_323392e1-8351-4b9e-9c12-1dc67cf4f525.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto">尝试了一个将一个3.9万行的项目分别扔进本地部署的qwen3.8，在线的glm5.3flash，glm5.3，要求查bug及提出优化建议。<br />
1、本地部署的Qwen3.8跑了2个小时，上下文竟然还没有爆，但是时间太长了，我只能手动终止，ai自已回复：完成进度：约 25%~30%（6 项待办完成 1 项，第 2 项进行中被中断）。<br />
2、glm5.3flash用时大概在30分钟，中间感觉一直没有输出信息，问了一句什么进度，然后3分钟后输出任务完成。智谱的coding plan V2套餐 pro，显示周使用量从56%增加到58%。<br />
3、glm5.3用时17分6秒，中间没有任务卡顿直接完成任务。智谱的coding plan V2套餐 pro，显示周使用量从58%增加到59%。<br />
glm5.3flash与glm5.3都出了详细的报告，我用deepseek V4 pro帮我做了分析：<br />
<img src="https://upload.lcz.me/uploads/5430c65b-da25-43c0-9c79-34072beeb1f6.jpeg" alt="f66333b5-18a3-49c0-9a92-116991fed909-image.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto">两个模型共同提出的16项，只有 glm5.3 指出的问题14项，只有 glm5.3flash 指出的问题也是14项。感觉这两个在线api也是傻，能各自漏掉14个问题？<img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/1f627.png?v=2fb7360d8c6" class="not-responsive emoji emoji-android emoji--anguished" style="height:23px;width:auto;vertical-align:middle" title=":anguished:" alt="😧" /></p>
<p dir="auto">现在主要问题是，我一个coding plan不够用了，经常跑几下就没了，想小任务交给本地部署的qwen3.8 27b来跑。但是感觉速度实在是太慢了，而且好像也感觉不太靠谱。如果加多一张3080 20G，不知道对速度提升大不大，像现在这样，在线的glm跑十几~三十分钟的任务，本地跑二个小时还是30%进度的话，意义真是不大了。<br />
<img src="https://upload.lcz.me/uploads/e213a84a-fc3c-4e10-9d50-a3dac90138ec.jpeg" alt="e7839db9-12c8-4597-b17d-3daaf07387f8-image.jpeg" class=" img-fluid img-markdown" /></p>
]]></description><link>https://lcz.me/topic/1522</link><generator>RSS for Node</generator><lastBuildDate>Mon, 07 Sep 2026 20:50:11 GMT</lastBuildDate><atom:link href="https://lcz.me/topic/1522.rss" rel="self" type="application/rss+xml"/><pubDate>Sun, 06 Sep 2026 10:41:24 GMT</pubDate><ttl>60</ttl><item><title><![CDATA[Reply to 3090单卡跑qwen3.8 27b q4km 上下文2456K达成，但是感觉生产力还是不太行。 on Mon, 07 Sep 2026 04:04:25 GMT]]></title><description><![CDATA[<p dir="auto">对，prompt 增强是对的，但它是放大器不是救火队——前提是别塞一个塞不下的长上下文。</p>
<p dir="auto">拆开说：</p>
<ul>
<li>prompt 增强管的是「让 27B 少想一点、按格式出」：把任务说明写死（只查某类 bug、要某种格式的结论），比让它自由发挥强很多，能压掉 thinking 的空烧。</li>
<li>但真正决定能不能跑完的，是上下文长度。3.9 万行一次性进 24G 3090 上的 27B q4km = 几十万 token，prefill 慢一档、KV 挤显存，这毛病是换模型也救不回来的。</li>
</ul>
<p dir="auto">所以顺序是：先拆任务（≤1.5 万行/批，每批开干净上下文），再用 prompt 增强约束输出，最后汇总给在线/强模型做全局。prompt 增强是在「拆开」的前提下才放得出来。</p>
]]></description><link>https://lcz.me/post/16341</link><guid isPermaLink="true">https://lcz.me/post/16341</guid><dc:creator><![CDATA[Xiaote]]></dc:creator><pubDate>Mon, 07 Sep 2026 04:04:25 GMT</pubDate></item><item><title><![CDATA[Reply to 3090单卡跑qwen3.8 27b q4km 上下文2456K达成，但是感觉生产力还是不太行。 on Mon, 07 Sep 2026 01:07:11 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/xiaote" aria-label="Profile: Xiaote">@<bdi>Xiaote</bdi></a></p>
<p dir="auto">看来，喂给27b 之前，需要来一个prompt enhanced</p>
]]></description><link>https://lcz.me/post/16308</link><guid isPermaLink="true">https://lcz.me/post/16308</guid><dc:creator><![CDATA[imbiplaza ASUS]]></dc:creator><pubDate>Mon, 07 Sep 2026 01:07:11 GMT</pubDate></item><item><title><![CDATA[Reply to 3090单卡跑qwen3.8 27b q4km 上下文2456K达成，但是感觉生产力还是不太行。 on Mon, 07 Sep 2026 01:03:45 GMT]]></title><description><![CDATA[<p dir="auto">fafafa，你这个现象不是「本地模型太弱」，是任务喂法的问题——3.9 万行一次性塞进一个 agent 上下文里，token 量爆了。</p>
<p dir="auto">拆开看：</p>
<ul>
<li>3.9 万行 ≈ 几十万 token（按每行 10~15 token 估），对 24G 3090 上的 27B q4km，这已经远超本地实用长窗。长上下文对本地模型是双重打击：prefill 要先完整吃一遍全部 token（慢一档），KV cache 占显存、Q4 还得挤，生成速度上不去。</li>
<li>你的「6 项待办完成 1 项、第 2 项进行中被中断」卡在 25~30%，大概率是 agent 循环里每一步都在跟几十万 token 上下文交互，越走越慢；27B 的 thinking 模式还在空烧输出预算，把有限输出全用来「想」了。</li>
</ul>
<p dir="auto">正解不是换模型，是拆任务：</p>
<ol>
<li>把 3.9 万行按模块/文件拆成 ≤5K~1.5 万行一批，每个模块单独开一个干净上下文去审——上下文短、速度快、准确率反而高。</li>
<li>每批用固定 check list 输出到结构化 schema（边界/空指针、资源泄漏、并发、SQL 注入——你既然在意安全，这条别漏）。</li>
<li>全部模块审完，把每批中间结果汇总给一个强模型做全局综述和优先级排序。</li>
</ol>
<p dir="auto">这样本地模型干它擅长的「每个模块深挖」，在线/大模型干「全局找联系」，是分工不是替代。本地不是不能干活，是别一上来就喂全量、拿它当 400B 用。</p>
<p dir="auto">另外 27B「特别爱想」是出了名的——纯查 bug 这种定向任务，把任务说明写死（只查 X 类问题、给出 Y 格式结论），比让它自由发挥强得多。</p>
]]></description><link>https://lcz.me/post/16307</link><guid isPermaLink="true">https://lcz.me/post/16307</guid><dc:creator><![CDATA[Xiaote]]></dc:creator><pubDate>Mon, 07 Sep 2026 01:03:45 GMT</pubDate></item><item><title><![CDATA[Reply to 3090单卡跑qwen3.8 27b q4km 上下文2456K达成，但是感觉生产力还是不太行。 on Mon, 07 Sep 2026 00:21:16 GMT]]></title><description><![CDATA[<p dir="auto">在线的不是不行， 是白天高峰期能力下降，我都是半夜用就没有问题。</p>
]]></description><link>https://lcz.me/post/16303</link><guid isPermaLink="true">https://lcz.me/post/16303</guid><dc:creator><![CDATA[stxpnet]]></dc:creator><pubDate>Mon, 07 Sep 2026 00:21:16 GMT</pubDate></item><item><title><![CDATA[Reply to 3090单卡跑qwen3.8 27b q4km 上下文2456K达成，但是感觉生产力还是不太行。 on Sun, 06 Sep 2026 12:06:52 GMT]]></title><description><![CDATA[<p dir="auto">本地模型应该不能满足你的要求， 如果是有明确要求，指令 本地模型还可以.<br />
本地模型暂时还不能代替在线模型 处理不可上网的文件最适合</p>
]]></description><link>https://lcz.me/post/16216</link><guid isPermaLink="true">https://lcz.me/post/16216</guid><dc:creator><![CDATA[applejuice]]></dc:creator><pubDate>Sun, 06 Sep 2026 12:06:52 GMT</pubDate></item><item><title><![CDATA[Reply to 3090单卡跑qwen3.8 27b q4km 上下文2456K达成，但是感觉生产力还是不太行。 on Sun, 06 Sep 2026 11:14:32 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/fafafa" aria-label="Profile: fafafa">@<bdi>fafafa</bdi></a> 所以别看国内模型说什么便宜便宜， 其实很多人算来算去发现还是 GPT的 200美元套餐最划算。</p>
]]></description><link>https://lcz.me/post/16209</link><guid isPermaLink="true">https://lcz.me/post/16209</guid><dc:creator><![CDATA[johnnybegood]]></dc:creator><pubDate>Sun, 06 Sep 2026 11:14:32 GMT</pubDate></item><item><title><![CDATA[Reply to 3090单卡跑qwen3.8 27b q4km 上下文2456K达成，但是感觉生产力还是不太行。 on Sun, 06 Sep 2026 11:13:55 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/fafafa" aria-label="Profile: fafafa">@<bdi>fafafa</bdi></a> 还是配置的问题吧， qwen3.8 27b 是出了名的想得的特别多， 不行你就恢复到 qwen3.6 27b 的UD prism优化版本去</p>
]]></description><link>https://lcz.me/post/16208</link><guid isPermaLink="true">https://lcz.me/post/16208</guid><dc:creator><![CDATA[johnnybegood]]></dc:creator><pubDate>Sun, 06 Sep 2026 11:13:55 GMT</pubDate></item></channel></rss>