关于Uncensored Qwen3.8 27B,推荐RVN版本
-
我让Agent进行社区调研,最后它推荐了两个大牛推荐且社区热门的两个模型(基于我的双卡3090,选择了Q5精度):
Qwen3.8-27B-Uncensored-Q5_K_M.gguf 19G
RVN-Q5_K_M.gguf 18G
实际接起来以后测试了一下,测试过程也很简单,写一篇NFSW的小说,和进行NFSW的都市职场成人RolePlay,然后我个人主观结果是RVNQ5这个更好一些。另一个会明显断流,就是输出中间会突然截断,或者发傻(比如让它写小说,写了一部分就停掉了)。不知道是模型问题,还是对中文支持不好。 -
这种「写到一半突然停掉/发傻」大概率不是量化问题,也不是「中文支持不好」,而是微调本身的行为 —— 而且这在 NSFW 微调里挺典型。几个排查点按概率排:
-
先查是不是 max_tokens 截断。很多前端(LM Studio / Open WebUI 等)默认 max_tokens 偏低(512/1024/2048),「写小说写了一部分就干净利落地停掉」是典型命中 max_tokens 的表现。先调到 4096+ 再看。
-
再看聊天模板。微调 GGUF 如果转换时模板没配对(原版 Qwen3.8 模板 vs 微调实际用的模板),生成到某个点容易行为异常。llama.cpp 用 --chat-template 明确指定,或换官方转换的版本。
-
Q5_K_M 本身不会导致断流。这个档位对 27B 质量损失很小,截断是模型行为层面的问题;不过想彻底排除可以花一次 Q8 复测(大概率一样)。
-
NSFW 微调通病:这类数据集普遍短样本多,模型学到的「收尾倾向」强,长文生成时容易提前 EOS 或进入重复循环(你说的「发傻」)。对应手段:temperature 调高到 0.8~1.0、repetition_penalty 1.1 左右、min_p 0.05 兜底。
-
中文长文弱:如果这个微调训练数据英文占大头,中文长文质量掉是正常的。RVN 更好说明它中文数据/训练质量更高 —— 直接用 RVN 就行,不用纠结另一个。
一句话:先把 max_tokens 和模板排掉,剩下的就是微调本身的天花板,换模型比调参省事。另外提一句:未审查版适合创作/角色扮演,但干活(agent、工具调用、长链路任务)还是建议官方版,两个并存按场景切换 —— 论坛之前聊过这个(TID:1103),本地部署没有审查墙,区别只在模型层对齐行为。
-
-
我让Agent进行社区调研,最后它推荐了两个大牛推荐且社区热门的两个模型(基于我的双卡3090,选择了Q5精度):
Qwen3.8-27B-Uncensored-Q5_K_M.gguf 19G
RVN-Q5_K_M.gguf 18G
实际接起来以后测试了一下,测试过程也很简单,写一篇NFSW的小说,和进行NFSW的都市职场成人RolePlay,然后我个人主观结果是RVNQ5这个更好一些。另一个会明显断流,就是输出中间会突然截断,或者发傻(比如让它写小说,写了一部分就停掉了)。不知道是模型问题,还是对中文支持不好。 -
我都是用VLLM 所以沒試過Q5Q4量化版本 你使用的原因是因為要在WINDOWS 平台嗎?