随手记录:Qwen3.8:27b vs Qwen3.6:27b 实测对比 🧪
-
会的,xhigh 死循环/空转不是个例,论坛上有现成证据链:
-
TID:1136 里 terry 实测 3.8 长链推理频繁崩溃("替代 DeepSeek 不现实"),那还只是默认档;xhigh 是最高思考预算,思考链最长,一旦模型在某个子问题上反复绕圈,就是纯空转——只费电不做功。
-
6% 这个数字跟论坛体感对得上,而且概率不是均匀的:任务越难、链路越长越容易触发,hard 任务上比 6% 高不少也正常。
-
档位怎么选(包磊 TID:1147 实测):low/medium 实测效果几乎无差;xhigh 只在一次性高难度题上有意义——stxpnet 说"一次成功率提升"也是真的,但代价是时间和死循环风险。给 agent/长链任务用就锁 low/medium;一次性难题可以开 xhigh,但要能等,超时手动打断重问一次就行。
-
想省心可以装 froggeric/Qwen-Fixed-Chat-Templates(TID:1151),v22 模板对思考档位控制更好,还能 enable_thinking=false 开快速档。
一句话:xhigh 是"高难度单题"档,不是"日常/长链"档。
-
-
qwen3.8:27b vs qwen3.6:27b — Thinking 模式实测对比
测试环境:内网 AI 服务器(Ubuntu + AMD 7900 XTX 24G + ROCm 7.x + Ollama 0.32.13)
调用方式:OpenAI 兼容接口,max_tokens=6000,非流式
测试时间:2026-08-19背景
qwen3.8:27b 默认 thinking = max,慢到令人发指(简单问题也要等 3-5 分钟)。给请求注入
reasoning_effort: medium后明显改善。但有人还在用 qwen3.6:27b,于是做了一组公平对比。测试设计
两道长链推理题,统一参数发送:
- 过桥题:四人过桥(1/2/5/10 分钟),求最短总时间及方案(经典优化题,答案 17 分钟)
- 逻辑题:5 人 5 题答对关系,求哪题答错人数最多(多约束推理,答案:第 1 题,B/C/E)
三组配置:
编号 模型 thinking 模式 说明 A qwen3.8:27b medium 服务端默认注入 B qwen3.6:27b medium 同等级,对比模型质量 C qwen3.6:27b default 不传 reasoning_effort,模型自然 thinking 结果
第一轮(max_tokens=3000)
配置 过桥题 正文输出 思考长度 耗时 正确? A: 3.8+medium 推理得 17 分钟 119 字(截断) 3842 字 63s 正文被 max_tokens 截断 B: 3.6+medium — 0 字 7867 字 100s 全部 token 被思考吃光
3.6+default17 分钟 885 字 5856 字 85s 正确 3.6 + medium 直接坏掉:3000 token 全被 thinking 消耗,正文输出 0 字符。和 3.8 + max 的问题如出一辙。
第二轮(max_tokens=6000,只测两个可用配置)
配置 任务 耗时 正文 思考 Token 正确? 3.8+medium 过桥 61.8s 994 字 5831 字 2646 17 分钟 3.6+default 过桥 112.9s 1346 字 5897 字 3305 17 分钟 3.8+medium 逻辑 19.3s 564 字 413 字 777 第1题 BCE 3.6+default 逻辑 86.5s 634 字 5397 字 2532 第1题 BCE 汇总
指标 3.8 + medium 3.6 + default 倍率 总耗时 81.1s 199.4s 3.8 快 2.5x 总 token 3423 5837 3.8 省 1.7x 逻辑题思考长度 413 字 5397 字 3.8 少 13x 两题正确率 2/2 2/2 持平 分析
1. 速度:3.8 碾压
过桥题 62s vs 113s(快 1.8x),逻辑题 19s vs 87s(快 4.5x)。简单任务上差距最大——3.6 不管题目难易都重度思考,3.8 会自适应:难题 5831 字符思考,简单题仅 413 字符。
2. Token 效率:3.8 省三倍
3.8 总用 3423 token,3.6 用 5837。3.6 在逻辑题上花了 2532 token,其中 5397 字符是英文思考过程——对"统计答错人数"这种题来说严重过度推理。
3. 质量:打平
两道题两个模型都答对了。3.8 的过桥答案带了下界证明(数学严谨),3.6 的带了两种策略公式对比。都是好答案。
4. 3.6 + medium 不可用
这是最关键的发现:给 3.6 显式设
reasoning_effort=medium会导致 thinking 吞掉全部 token 预算,正文输出为零。3.6 只能用 default(不加 effort 字段),但那样又慢又费 token。结论
主力模型用
qwen3.8:27b+think=medium。- 速度快 2.5 倍
- Token 省 1.7 倍
- 答题质量相同
- 3.8 会根据任务难度自适应思考量,3.6 不会
- 服务端注入
reasoning_effort: medium是当前最优配置
如果还有客户端在用
qwen3.6:27b,改成qwen3.8:27b即可——速度翻倍,质量不变。
补充:Ollama 的 thinking 等级合法值为
low / medium / high / max / true / false。OpenAI 兼容端点的reasoning_effort会被自动映射为对应等级;客户端自带的值优先于服务端默认值。 -
,
T terry 固定了此主题
-

唉,不知道怎么搞了 -

唉,不知道怎么搞了 -
,系统 取消固定了此主题

