<?xml version="1.0" encoding="UTF-8"?><rss xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title><![CDATA[AI初学者，deepseek Harness + LMstudio 的问题]]></title><description><![CDATA[<p dir="auto">已达到输出 token 上限回答被截断，已有输出保留在对话中。发送“继续”可让模型接着输出。<br />
这是什么问题，怎么解决啊，求大神们指教。</p>
]]></description><link>https://lcz.me/topic/1380</link><generator>RSS for Node</generator><lastBuildDate>Wed, 23 Sep 2026 05:48:31 GMT</lastBuildDate><atom:link href="https://lcz.me/topic/1380.rss" rel="self" type="application/rss+xml"/><pubDate>Fri, 28 Aug 2026 04:54:28 GMT</pubDate><ttl>60</ttl><item><title><![CDATA[Reply to AI初学者，deepseek Harness + LMstudio 的问题 on Fri, 28 Aug 2026 09:55:50 GMT]]></title><description><![CDATA[<p dir="auto">在LMS里把Models defaults中的Default Context Length 改成 Model maximum<br />
重启LMS。暂时好了。</p>
]]></description><link>https://lcz.me/post/14597</link><guid isPermaLink="true">https://lcz.me/post/14597</guid><dc:creator><![CDATA[wangqi124]]></dc:creator><pubDate>Fri, 28 Aug 2026 09:55:50 GMT</pubDate></item><item><title><![CDATA[Reply to AI初学者，deepseek Harness + LMstudio 的问题 on Fri, 28 Aug 2026 08:32:52 GMT]]></title><description><![CDATA[<p dir="auto">新开一个会话，选择“创造模式“ 输入：</p>
<pre><code>创建一个新的插件： 当会话因为“已达到输出 token 上限”中断时， 自动输入“继续”.
</code></pre>
<p dir="auto">会自动为你编写一个插件并启用</p>
<p dir="auto">另外， 修改settings.yaml， 在模型下面修改<br />
maxTokens：匹配你的模型上下文</p>
<p dir="auto">如：</p>
<pre><code>llm-pi-ai:
  providers:
    llamacpp:
      displayName: Local llama.cpp
      api: openai-completions
      baseURL: 
      compat:
        maxTokensField: max_tokens
      defaultInput: [ text, image ]
      models:
        - id: qwen3.8-27b-q5km
          maxTokens: 143360
</code></pre>
<p dir="auto">compat很重要， 否则DSH不发送maxTokens</p>
]]></description><link>https://lcz.me/post/14574</link><guid isPermaLink="true">https://lcz.me/post/14574</guid><dc:creator><![CDATA[exllm]]></dc:creator><pubDate>Fri, 28 Aug 2026 08:32:52 GMT</pubDate></item><item><title><![CDATA[Reply to AI初学者，deepseek Harness + LMstudio 的问题 on Fri, 28 Aug 2026 07:40:58 GMT]]></title><description><![CDATA[<p dir="auto">谢谢，我想结束这场问答，让token还原，可以吗？我开新对话，我刚问个你好就报错。<br />
上下文注入<br />
@deepseek-ai/dsh-system-prompt<br />
没完没了，你说怎么办</p>
]]></description><link>https://lcz.me/post/14567</link><guid isPermaLink="true">https://lcz.me/post/14567</guid><dc:creator><![CDATA[wangqi124]]></dc:creator><pubDate>Fri, 28 Aug 2026 07:40:58 GMT</pubDate></item><item><title><![CDATA[Reply to AI初学者，deepseek Harness + LMstudio 的问题 on Fri, 28 Aug 2026 07:08:54 GMT]]></title><description><![CDATA[<p dir="auto">这是正常的截断提示，不是故障：模型单次回答的"输出 token"达到了上限（LM Studio 里叫 Max output tokens，DSH/harness 里是 max_tokens 参数）。</p>
<p dir="auto">有个容易忽略的点：现在不少模型带 thinking（思考过程），思考内容也算输出 token——思考写太长会把预算吃光，正文没写完就被掐断了，你这个报错基本就是这个情况。</p>
<p dir="auto">解决按顺序试：</p>
<ol>
<li>把 max_tokens / Max output tokens 拉高到 16K~32K，这是最直接的解法；</li>
<li>降低思考强度（effort 调低或关长思考模式）；</li>
<li>已经发生的话直接发"继续"，模型会接着往下写。</li>
</ol>
<p dir="auto">一句话：调大输出上限就行，不是模型坏了，也不是 LM Studio 出 bug。</p>
]]></description><link>https://lcz.me/post/14556</link><guid isPermaLink="true">https://lcz.me/post/14556</guid><dc:creator><![CDATA[Xiaote]]></dc:creator><pubDate>Fri, 28 Aug 2026 07:08:54 GMT</pubDate></item><item><title><![CDATA[Reply to AI初学者，deepseek Harness + LMstudio 的问题 on Fri, 28 Aug 2026 05:41:06 GMT]]></title><description><![CDATA[<p dir="auto">没啥问题，你问自己的angent，让它自己修就行了。</p>
]]></description><link>https://lcz.me/post/14540</link><guid isPermaLink="true">https://lcz.me/post/14540</guid><dc:creator><![CDATA[terry]]></dc:creator><pubDate>Fri, 28 Aug 2026 05:41:06 GMT</pubDate></item></channel></rss>