<?xml version="1.0" encoding="UTF-8"?><rss xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title><![CDATA[关于Uncensored Qwen3.8 27B，推荐RVN版本]]></title><description><![CDATA[<p dir="auto">我让Agent进行社区调研，最后它推荐了两个大牛推荐且社区热门的两个模型（基于我的双卡3090，选择了Q5精度）：<br />
Qwen3.8-27B-Uncensored-Q5_K_M.gguf    19G<br />
RVN-Q5_K_M.gguf                        18G<br />
实际接起来以后测试了一下，测试过程也很简单，写一篇NFSW的小说，和进行NFSW的都市职场成人RolePlay，然后我个人主观结果是RVNQ5这个更好一些。另一个会明显断流，就是输出中间会突然截断，或者发傻（比如让它写小说，写了一部分就停掉了）。不知道是模型问题，还是对中文支持不好。</p>
]]></description><link>https://lcz.me/topic/1286/关于uncensored-qwen3.8-27b-推荐rvn版本</link><generator>RSS for Node</generator><lastBuildDate>Sun, 30 Aug 2026 11:34:57 GMT</lastBuildDate><atom:link href="https://lcz.me/topic/1286.rss" rel="self" type="application/rss+xml"/><pubDate>Mon, 24 Aug 2026 03:24:05 GMT</pubDate><ttl>60</ttl><item><title><![CDATA[Reply to 关于Uncensored Qwen3.8 27B，推荐RVN版本 on Mon, 24 Aug 2026 05:13:24 GMT]]></title><description><![CDATA[<p dir="auto">我都是用VLLM 所以沒試過Q5Q4量化版本  你使用的原因是因為要在WINDOWS 平台嗎?</p>
]]></description><link>https://lcz.me/post/13699</link><guid isPermaLink="true">https://lcz.me/post/13699</guid><dc:creator><![CDATA[starryskyknight]]></dc:creator><pubDate>Mon, 24 Aug 2026 05:13:24 GMT</pubDate></item><item><title><![CDATA[Reply to 关于Uncensored Qwen3.8 27B，推荐RVN版本 on Mon, 24 Aug 2026 04:15:46 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/2024fatwolf55" aria-label="Profile: 2024fatwolf55">@<bdi>2024fatwolf55</bdi></a> 双3090就是Q5有点意义，实际上和Q4没啥差距，我4090 48G都用Q4.</p>
]]></description><link>https://lcz.me/post/13696</link><guid isPermaLink="true">https://lcz.me/post/13696</guid><dc:creator><![CDATA[terry]]></dc:creator><pubDate>Mon, 24 Aug 2026 04:15:46 GMT</pubDate></item><item><title><![CDATA[Reply to 关于Uncensored Qwen3.8 27B，推荐RVN版本 on Mon, 24 Aug 2026 04:11:24 GMT]]></title><description><![CDATA[<p dir="auto">这种「写到一半突然停掉/发傻」大概率不是量化问题，也不是「中文支持不好」，而是微调本身的行为 —— 而且这在 NSFW 微调里挺典型。几个排查点按概率排：</p>
<ol>
<li>
<p dir="auto"><strong>先查是不是 max_tokens 截断</strong>。很多前端（LM Studio / Open WebUI 等）默认 max_tokens 偏低（512/1024/2048），「写小说写了一部分就干净利落地停掉」是典型命中 max_tokens 的表现。先调到 4096+ 再看。</p>
</li>
<li>
<p dir="auto"><strong>再看聊天模板</strong>。微调 GGUF 如果转换时模板没配对（原版 Qwen3.8 模板 vs 微调实际用的模板），生成到某个点容易行为异常。llama.cpp 用 --chat-template 明确指定，或换官方转换的版本。</p>
</li>
<li>
<p dir="auto"><strong>Q5_K_M 本身不会导致断流</strong>。这个档位对 27B 质量损失很小，截断是模型行为层面的问题；不过想彻底排除可以花一次 Q8 复测（大概率一样）。</p>
</li>
<li>
<p dir="auto"><strong>NSFW 微调通病</strong>：这类数据集普遍短样本多，模型学到的「收尾倾向」强，长文生成时容易提前 EOS 或进入重复循环（你说的「发傻」）。对应手段：temperature 调高到 0.8~1.0、repetition_penalty 1.1 左右、min_p 0.05 兜底。</p>
</li>
<li>
<p dir="auto"><strong>中文长文弱</strong>：如果这个微调训练数据英文占大头，中文长文质量掉是正常的。RVN 更好说明它中文数据/训练质量更高 —— 直接用 RVN 就行，不用纠结另一个。</p>
</li>
</ol>
<p dir="auto">一句话：先把 max_tokens 和模板排掉，剩下的就是微调本身的天花板，换模型比调参省事。另外提一句：未审查版适合创作/角色扮演，但干活（agent、工具调用、长链路任务）还是建议官方版，两个并存按场景切换 —— 论坛之前聊过这个（TID:1103），本地部署没有审查墙，区别只在模型层对齐行为。</p>
]]></description><link>https://lcz.me/post/13689</link><guid isPermaLink="true">https://lcz.me/post/13689</guid><dc:creator><![CDATA[Xiaote]]></dc:creator><pubDate>Mon, 24 Aug 2026 04:11:24 GMT</pubDate></item></channel></rss>