跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
折叠
品牌标识

抡锤者

  1. 主页
  2. 版块
  3. LLM讨论区
  4. 随手记录:Qwen3.8:27b vs Qwen3.6:27b 实测对比 🧪

随手记录:Qwen3.8:27b vs Qwen3.6:27b 实测对比 🧪

已定时 已固定 已锁定 已移动 LLM讨论区
qwen-27b
15 帖子 9 发布者 440 浏览
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • 九龙杨生九 九龙杨生

    @stxpnet 不是说开了思考Xhigh比较容易陷入死循环吗?我看他们的截图有超过6%可能性;

    stxpnetS 离线
    stxpnetS 离线
    stxpnet
    超凡大师
    编写于 最后由 编辑
    #6

    @九龙杨生 看自己的模型和硬件吧,我这KV CACHE池有2X 256K容量,我平时主要被HINDSIGHT卡死的. 如果没测过自己实战里面超过180K上下文的实际表现和速度,再谈循环也是枉然吧? 特别是llama.cpp,基本就是玩具的,这里量化,那里量化,上下文还打折,别指望它能发挥全部实力

    26-08-19
    双卡3090(8x8x无nvlink,p2p驱动) +Sglang+qwen 3.8 27B awq模型 [功耗异常弃用]
    8-20 用vllm 0.26+ Qwen3.8-27B-SmoothQuant-W8A8-INT8 200K上下文 ~50t/s

    1 条回复 最后回复
    0
    • N 离线
      N 离线
      neo
      德高望重
      编写于 最后由 编辑
      #7

      我觉得应用3.8思维深度的medium档去与3.6去对比,因为medium档是没有额外指令的,其他两个都有额外指令,3.6默认也没有(猜的)。

      1 条回复 最后回复
      0
      • stxpnetS 离线
        stxpnetS 离线
        stxpnet
        超凡大师
        编写于 最后由 编辑
        #8

        内部思维链应该是也调整过,总体还是超过预期,本来我以为只是3.6套个 壳换下版本号,没想到还真有东西。

        26-08-19
        双卡3090(8x8x无nvlink,p2p驱动) +Sglang+qwen 3.8 27B awq模型 [功耗异常弃用]
        8-20 用vllm 0.26+ Qwen3.8-27B-SmoothQuant-W8A8-INT8 200K上下文 ~50t/s

        1 条回复 最后回复
        0
        • Fan RexF 离线
          Fan RexF 离线
          Fan Rex
          编写于 最后由 编辑
          #9
          此主題已被删除!
          1 条回复 最后回复
          0
          • Fan RexF 离线
            Fan RexF 离线
            Fan Rex
            编写于 最后由 编辑
            #10
            此主題已被删除!
            1 条回复 最后回复
            0
            • Fan RexF 离线
              Fan RexF 离线
              Fan Rex
              编写于 最后由 编辑
              #11

              qwen3.8:27b vs qwen3.6:27b — Thinking 模式实测对比

              测试环境:内网 AI 服务器(Ubuntu + AMD 7900 XTX 24G + ROCm 7.x + Ollama 0.32.13)
              调用方式:OpenAI 兼容接口,max_tokens=6000,非流式
              测试时间:2026-08-19

              背景

              qwen3.8:27b 默认 thinking = max,慢到令人发指(简单问题也要等 3-5 分钟)。给请求注入 reasoning_effort: medium 后明显改善。但有人还在用 qwen3.6:27b,于是做了一组公平对比。

              测试设计

              两道长链推理题,统一参数发送:

              • 过桥题:四人过桥(1/2/5/10 分钟),求最短总时间及方案(经典优化题,答案 17 分钟)
              • 逻辑题:5 人 5 题答对关系,求哪题答错人数最多(多约束推理,答案:第 1 题,B/C/E)

              三组配置:

              编号 模型 thinking 模式 说明
              A qwen3.8:27b medium 服务端默认注入
              B qwen3.6:27b medium 同等级,对比模型质量
              C qwen3.6:27b default 不传 reasoning_effort,模型自然 thinking

              结果

              第一轮(max_tokens=3000)

              配置 过桥题 正文输出 思考长度 耗时 正确?
              A: 3.8+medium 推理得 17 分钟 119 字(截断) 3842 字 63s 正文被 max_tokens 截断
              B: 3.6+medium — 0 字 7867 字 100s 全部 token 被思考吃光
              😄 3.6+default 17 分钟 885 字 5856 字 85s 正确

              3.6 + medium 直接坏掉:3000 token 全被 thinking 消耗,正文输出 0 字符。和 3.8 + max 的问题如出一辙。

              第二轮(max_tokens=6000,只测两个可用配置)

              配置 任务 耗时 正文 思考 Token 正确?
              3.8+medium 过桥 61.8s 994 字 5831 字 2646 17 分钟
              3.6+default 过桥 112.9s 1346 字 5897 字 3305 17 分钟
              3.8+medium 逻辑 19.3s 564 字 413 字 777 第1题 BCE
              3.6+default 逻辑 86.5s 634 字 5397 字 2532 第1题 BCE

              汇总

              指标 3.8 + medium 3.6 + default 倍率
              总耗时 81.1s 199.4s 3.8 快 2.5x
              总 token 3423 5837 3.8 省 1.7x
              逻辑题思考长度 413 字 5397 字 3.8 少 13x
              两题正确率 2/2 2/2 持平

              分析

              1. 速度:3.8 碾压

              过桥题 62s vs 113s(快 1.8x),逻辑题 19s vs 87s(快 4.5x)。简单任务上差距最大——3.6 不管题目难易都重度思考,3.8 会自适应:难题 5831 字符思考,简单题仅 413 字符。

              2. Token 效率:3.8 省三倍

              3.8 总用 3423 token,3.6 用 5837。3.6 在逻辑题上花了 2532 token,其中 5397 字符是英文思考过程——对"统计答错人数"这种题来说严重过度推理。

              3. 质量:打平

              两道题两个模型都答对了。3.8 的过桥答案带了下界证明(数学严谨),3.6 的带了两种策略公式对比。都是好答案。

              4. 3.6 + medium 不可用

              这是最关键的发现:给 3.6 显式设 reasoning_effort=medium 会导致 thinking 吞掉全部 token 预算,正文输出为零。3.6 只能用 default(不加 effort 字段),但那样又慢又费 token。

              结论

              主力模型用 qwen3.8:27b + think=medium。

              • 速度快 2.5 倍
              • Token 省 1.7 倍
              • 答题质量相同
              • 3.8 会根据任务难度自适应思考量,3.6 不会
              • 服务端注入 reasoning_effort: medium 是当前最优配置

              如果还有客户端在用 qwen3.6:27b,改成 qwen3.8:27b 即可——速度翻倍,质量不变。


              补充:Ollama 的 thinking 等级合法值为 low / medium / high / max / true / false。OpenAI 兼容端点的 reasoning_effort 会被自动映射为对应等级;客户端自带的值优先于服务端默认值。

              1 条回复 最后回复
              3
              • terryT 离线
                terryT 离线
                terry
                超级版主
                编写于 最后由 编辑
                #12

                3.8在编程上体感是大幅领先于3.6,3.6接入Agent根本不能干啥正儿八经的活,3.8则大部分工作都能完成。数据很详细,虽然是AI整理的,但是贴主主导思想,把握的很好。格式公正,易于阅读,置顶。

                油管:https://www.youtube.com/@抡锤者

                1 条回复 最后回复
                0
                • ,terryT terry 固定了此主题
                • stxpnetS 离线
                  stxpnetS 离线
                  stxpnet
                  超凡大师
                  编写于 最后由 编辑
                  #13

                  更新一下,我目前用签名的模型,双卡单流256K,已经稳定使用了。再也不折腾本地基础设施了。

                  ac1bc264-2226-458f-9be7-c48351e7f899-image.jpeg

                  064a8c3a-79af-4aec-8df5-5d21e47198e3-image.jpeg

                  26-08-19
                  双卡3090(8x8x无nvlink,p2p驱动) +Sglang+qwen 3.8 27B awq模型 [功耗异常弃用]
                  8-20 用vllm 0.26+ Qwen3.8-27B-SmoothQuant-W8A8-INT8 200K上下文 ~50t/s

                  1 条回复 最后回复
                  0
                  • daniel zhouD 离线
                    daniel zhouD 离线
                    daniel zhou
                    编写于 最后由 编辑
                    #14

                    35de943f-8efa-47bf-b274-f61d1e7e7c07-image.jpeg
                    唉,不知道怎么搞了

                    wwcd2016W 1 条回复 最后回复
                    0
                    • daniel zhouD daniel zhou

                      35de943f-8efa-47bf-b274-f61d1e7e7c07-image.jpeg
                      唉,不知道怎么搞了

                      wwcd2016W 离线
                      wwcd2016W 离线
                      wwcd2016
                      编写于 最后由 编辑
                      #15

                      @daniel-zhou 说:

                      35de943f-8efa-47bf-b274-f61d1e7e7c07-image.jpeg
                      唉,不知道怎么搞了

                      我的结论以下。单卡3090 24g不适合干很重的活,而轻量的不如走api。
                      老特也推荐,跑图文必须自己搞。llm 买api合适。

                      1 条回复 最后回复
                      0
                      • ,系统 取消固定了此主题

                      你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

                      厌倦了每次访问都刷到同样的帖子?您注册账号后,您每次返回时都能精准定位到您上次浏览的位置,并可选择接收新回复通知(通过邮件或推送通知)。您还能收藏书签、为帖子顶,向社区成员表达您的欣赏。

                      有了你的建议,这篇帖子会更精彩哦 💗

                      注册 登录
                      回复
                      • 在新帖中回复
                      登录后回复
                      • 从旧到新
                      • 从新到旧
                      • 最多赞同


                      • 登录

                      • 登录或注册以进行搜索。
                      • 第一个帖子
                        最后一个帖子
                      0
                      • 版块
                      • 最新
                      • 标签
                      • 热门
                      • 用户
                      • 群组