<?xml version="1.0" encoding="UTF-8"?><rss xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title><![CDATA[新手求助 Qwen3.8 27b 卡tokens上限了 怎么破？]]></title><description><![CDATA[<p dir="auto">如题 在把剧本改成ai 分镜提示词时 卡tokens上限了 不知道 提高 上限 配置是3090ti 24G的显卡 128g d3 x99平台</p>
]]></description><link>https://lcz.me/topic/1892</link><generator>RSS for Node</generator><lastBuildDate>Fri, 25 Sep 2026 21:27:24 GMT</lastBuildDate><atom:link href="https://lcz.me/topic/1892.rss" rel="self" type="application/rss+xml"/><pubDate>Tue, 22 Sep 2026 11:39:59 GMT</pubDate><ttl>60</ttl><item><title><![CDATA[Reply to 新手求助 Qwen3.8 27b 卡tokens上限了 怎么破？ on Tue, 22 Sep 2026 15:08:08 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/perter" aria-label="Profile: perter">@<bdi>perter</bdi></a> 好的谢谢 已解决<img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/1f61c.png?v=ecb7c61779a" class="not-responsive emoji emoji-android emoji--stuck_out_tongue_winking_eye" style="height:23px;width:auto;vertical-align:middle" title=":stuck_out_tongue_winking_eye:" alt="😜" /></p>
]]></description><link>https://lcz.me/post/20106</link><guid isPermaLink="true">https://lcz.me/post/20106</guid><dc:creator><![CDATA[huan chow]]></dc:creator><pubDate>Tue, 22 Sep 2026 15:08:08 GMT</pubDate></item><item><title><![CDATA[Reply to 新手求助 Qwen3.8 27b 卡tokens上限了 怎么破？ on Tue, 22 Sep 2026 13:28:36 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/huan-chow" aria-label="Profile: huan-chow">@<bdi>huan-chow</bdi></a><br />
想把上下文扩大到64K，可以在 llama-server.exe 的启动命令里追加参数 -c 65536 或者 --ctx-size 65536</p>
]]></description><link>https://lcz.me/post/20084</link><guid isPermaLink="true">https://lcz.me/post/20084</guid><dc:creator><![CDATA[perter]]></dc:creator><pubDate>Tue, 22 Sep 2026 13:28:36 GMT</pubDate></item><item><title><![CDATA[Reply to 新手求助 Qwen3.8 27b 卡tokens上限了 怎么破？ on Tue, 22 Sep 2026 13:02:38 GMT]]></title><description><![CDATA[<p dir="auto">先分清「上限」是哪一个，三种最常见：</p>
<ol>
<li><strong>服务端上下文上限</strong>（llama.cpp 的 <code>-c</code>、Ollama 的 <code>num_ctx</code>、vLLM 的 <code>--max-model-len</code>）——你说的多半是这个，默认常常只给 4k～8k，不会自动按显存放开。</li>
<li><strong>模型训练上下文</strong>：Qwen3.8-27B 支持到 128k 级，但那是天花板，不是免费额度。</li>
<li><strong>单次输出上限</strong>（<code>max_tokens</code> / <code>-n</code>）：和输入共用预算，写分镜时很容易先被输出顶住。</li>
</ol>
<p dir="auto">3090Ti 24G 跑 27B Q4，权重约 15–16G，剩下全给 KV，而 KV 随上下文线性涨，这是硬约束。要做长上下文，先做三件事：</p>
<ul>
<li><strong>KV 量化</strong>：q8 KV（llama.cpp <code>-ctk q8_0 -ctv q8_0</code>，vLLM <code>--kv-cache-dtype fp8</code>），显存占用直接减半，长上下文质量损失很小；别用 BF16 KV 硬撑。</li>
<li><strong>开 FlashAttention，并发压到 1</strong>，把显存全让给 KV；24G + q8 KV 大致能到 32k～64k 量级，具体以框架报的 KV 占用为准。</li>
<li><strong>确认没有层 offload 到 128G DDR3</strong>：X99 的 DDR3 每通道带宽只有几十 GB/s，offload 一层 decode 就断崖。</li>
</ul>
<p dir="auto">但「剧本 → 分镜提示词」这个任务，正解不是把单次上下文撑到 128k，而是<strong>分块</strong>：</p>
<ol>
<li>先让模型输出结构化大纲：「场号 / 地点 / 人物 / 情绪 / 镜头目的」；</li>
<li>再按场（或每 5–8 个镜头）分段喂，每段都带同一份角色表 + 风格锚（固定 system prompt），逐段出分镜；</li>
<li>每段上下文只有几 k，比一次塞满更稳，还能断点续跑。</li>
</ol>
<p dir="auto">一句话：上限先按显存调到装得下的最大值，任务本身用分段解决。</p>
]]></description><link>https://lcz.me/post/20074</link><guid isPermaLink="true">https://lcz.me/post/20074</guid><dc:creator><![CDATA[Xiaote]]></dc:creator><pubDate>Tue, 22 Sep 2026 13:02:38 GMT</pubDate></item><item><title><![CDATA[Reply to 新手求助 Qwen3.8 27b 卡tokens上限了 怎么破？ on Tue, 22 Sep 2026 11:47:10 GMT]]></title><description><![CDATA[<p dir="auto"><img src="https://upload.lcz.me/uploads/09eeb9b3-3526-4f6c-a27a-5c1688d935d2.png" alt="a0d8df9a-3d7c-4341-9d01-dd885f2b4bdc.png" class=" img-fluid img-markdown" /></p>
]]></description><link>https://lcz.me/post/20064</link><guid isPermaLink="true">https://lcz.me/post/20064</guid><dc:creator><![CDATA[huan chow]]></dc:creator><pubDate>Tue, 22 Sep 2026 11:47:10 GMT</pubDate></item></channel></rss>