跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 AI 广场
  1. 主页
  2. 版块
  3. LLM讨论区
  4. Qwen3.8-Flash-Next M5 Max实测

Qwen3.8-Flash-Next M5 Max实测

已定时 已固定 已锁定 已移动 LLM讨论区
qwenmacapple-m5
9 帖子 6 发布者 480 浏览
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • G 离线
    G 离线
    Gary Pan
    编写于 最后由 编辑
    #1

    直接说重点,好,但是需要优化。

    因为明天要出差,就简短一点,给大家一点启发。

    ngram 50b 左右的部分可以放到ssd里直接读,不需要进内存,实际上就是一个120b a6b的模型,4 bit也就50多gb,还只要a6b,潜力巨大。

    M5 MAX 实测结果:
    128k上下文 没有额外配置

    最快30 tokens,最慢降速到十几tokens。均值26.2
    这部分感觉优化空间很大,理论上ngram应该属于秒读不会影响模型速度,30tokens对于a6b有点不正常了。

    另外补充:
    这个模型的reasoning好像设置跟其他模型不太一样,想太多,设置一下应该会好很多。

    kos orK terryT J 3 条回复 最后回复
    3
    • G 离线
      G 离线
      Gary Pan
      编写于 最后由 编辑
      #2

      这是Hermes给的 llama.cpp 的设置表,供参考。
      llama.cpp 服务端 reasoning 相关 flag 全表(从 master 源码 common/arg.cpp 实读,非记忆):

      Flag: -rea / --reasoning
      参数值: on / off / auto
      默认: auto(从 chat template 自动检测)
      环境变量: LLAMA_ARG_REASONING
      作用: 总开关:thinking 开/关。on/off 会写入模板 kwarg enable_thinking
      能否被请求级覆盖: ✅ body 里 chat_template_kwargs.enable_thinking 或 reasoning_effort:"none" 可覆盖(实测确认)
      ────────────────────────────────────────
      Flag: --reasoning-effort
      参数值: default / minimal / low / medium / high / xhigh / max…
      默认: default(保持模板默认)
      环境变量: LLAMA_ARG_REASONING_EFFORT
      作用: 把档位塞进 chat template kwarg reasoning_effort——是否生效取决于模型模板认不认(Qwen3 系只认 on/off 布尔,不认档位)
      能否被请求级覆盖: ✅ body 里 chat_template_kwargs.reasoning_effort
      ────────────────────────────────────────
      Flag: --reasoning-budget
      参数值: N:-1 不限 / 0 立即结束 / >0 思考 token 上限
      默认: -1
      环境变量: LLAMA_ARG_THINK_BUDGET
      作用: 采样层的思考 token 预算——服务端硬截断,与模板无关,对不认 effort 的模型这是唯一有效的"限流"手段
      能否被请求级覆盖: ⚠️ body 有对应字段 thinking_budget_tokens(Anthropic 风格 thinking.budget_tokens 也会被翻译成它)
      ────────────────────────────────────────
      Flag: --reasoning-budget-message
      参数值: 任意文本
      默认: 无
      环境变量: LLAMA_ARG_THINK_BUDGET_MESSAGE
      作用: 预算耗尽时,在 end-of-thinking 标签前注入的提示语(引导模型收尾)
      能否被请求级覆盖: ❌ 仅启动级
      ────────────────────────────────────────
      Flag: --reasoning-preserve / --no-reasoning-preserve
      参数值: bool
      默认: 模板默认
      环境变量: —
      作用: 是否把思考痕迹保留在完整历史里(而非只有最后一条 assistant 消息)。需要模板有 supports_preserve_reasoning 能力
      能否被请求级覆盖: ✅ body kwarg preserve_reasoning
      ────────────────────────────────────────
      Flag: --reasoning-format
      参数值: none / deepseek / deepseek-legacy / auto
      默认: auto
      环境变量: LLAMA_ARG_THINK
      作用: 思考内容怎么交付:none=不解析留在 content;deepseek=放进 message.reasoning_content;legacy=两处都有
      能否被请求级覆盖: ✅ body 里 reasoning_format
      ────────────────────────────────────────
      Flag: --chat-template-kwargs
      参数值: JSON 对象
      默认: {}
      环境变量: LLAMA_ARG_CHAT_TEMPLATE_KWARGS
      作用: 任意模板 kwargs(你现在进程里的 {"enable_thinking": true, "preserve_thinking": true} 就是它设的)。⚠️ 新版已弃用 enable_thinking
      走这里,会打警告让你改用 --reasoning on/off
      能否被请求级覆盖: ✅ body 里 chat_template_kwargs 与之合并,请求值优先
      ────────────────────────────────────────
      Flag: --no-reasoning-in-content(force_pure_content 相关)
      参数值: bool
      默认: disabled
      环境变量: —
      作用: 禁止工具调用/思考混进 content 块
      能否被请求级覆盖: (随解析器配置,一般不用动)

      1 条回复 最后回复
      0
      • williamlouisW 在线
        williamlouisW 在线
        williamlouis
        超级版主
        编写于 最后由 编辑
        #3

        已经达到可用的程度了。
        按 Mac的功耗。这个模型可用价值一下就上来了。

        个人主页:xlkj.org Telegram https://t.me/xlkjorg

        1 条回复 最后回复
        0
        • G 离线
          G 离线
          Gary Pan
          编写于 最后由 编辑
          #4

          是的,感觉加上mtp,优化一下调用,速度应该能至少翻倍,就赢麻了,智力是完全够的

          1 条回复 最后回复
          0
          • G Gary Pan

            直接说重点,好,但是需要优化。

            因为明天要出差,就简短一点,给大家一点启发。

            ngram 50b 左右的部分可以放到ssd里直接读,不需要进内存,实际上就是一个120b a6b的模型,4 bit也就50多gb,还只要a6b,潜力巨大。

            M5 MAX 实测结果:
            128k上下文 没有额外配置

            最快30 tokens,最慢降速到十几tokens。均值26.2
            这部分感觉优化空间很大,理论上ngram应该属于秒读不会影响模型速度,30tokens对于a6b有点不正常了。

            另外补充:
            这个模型的reasoning好像设置跟其他模型不太一样,想太多,设置一下应该会好很多。

            kos orK 离线
            kos orK 离线
            kos or
            超凡大师
            编写于 最后由 编辑
            #5

            @Gary-Pan said:

            ngram 50b 左右的部分可以放到ssd里直接读,不需要进内存,实际上就是一个120b a6b的模型,4 bit也就50多gb,还只要a6b,潜力巨大。

            哇 謝謝分享 看樣子有機會可以試試看了 🙂

            1 条回复 最后回复
            0
            • stxpnetS 离线
              stxpnetS 离线
              stxpnet
              超凡大师
              编写于 最后由 stxpnet 编辑
              #6

              看了一下,心仪的UD Q4 XL是111GB啊: Qwen3.8-Flash-Next-GGUF
              /UD-Q4_K_XL 111 GB 我的配置是48G显存 64G内存,我不想卸载到SSD还差得远。不过有条32G的想挪过来换掉 就刚刚踩线
              Qwen3.8-Flash-Next-GGUF UD-IQ4_XS 93.7 GB 这个不换内存 似乎还刚好,有点心动了。

              不过我的决定是,死等 byteshape出 Qwen3.8-Flash-Next的GGUF ,这家的MOE模型调校非常好。同等体积下总是比别人的格式更均衡。

              26-08-19
              双卡3090(8x8x无nvlink,p2p驱动) +Sglang+qwen 3.8 27B awq模型 [功耗异常弃用]
              8-20 用vllm 0.26+ Qwen3.8-27B-SmoothQuant-W8A8-INT8 200K上下文 ~50t/s

              1 条回复 最后回复
              0
              • G Gary Pan

                直接说重点,好,但是需要优化。

                因为明天要出差,就简短一点,给大家一点启发。

                ngram 50b 左右的部分可以放到ssd里直接读,不需要进内存,实际上就是一个120b a6b的模型,4 bit也就50多gb,还只要a6b,潜力巨大。

                M5 MAX 实测结果:
                128k上下文 没有额外配置

                最快30 tokens,最慢降速到十几tokens。均值26.2
                这部分感觉优化空间很大,理论上ngram应该属于秒读不会影响模型速度,30tokens对于a6b有点不正常了。

                另外补充:
                这个模型的reasoning好像设置跟其他模型不太一样,想太多,设置一下应该会好很多。

                terryT 离线
                terryT 离线
                terry
                超级版主
                编写于 最后由 编辑
                #7

                @Gary-Pan 我弟回家后上图啊,就等着你这个做视频。

                油管:https://www.youtube.com/@抡锤者

                1 条回复 最后回复
                0
                • ,terryT terry 固定了此主题
                • G Gary Pan

                  直接说重点,好,但是需要优化。

                  因为明天要出差,就简短一点,给大家一点启发。

                  ngram 50b 左右的部分可以放到ssd里直接读,不需要进内存,实际上就是一个120b a6b的模型,4 bit也就50多gb,还只要a6b,潜力巨大。

                  M5 MAX 实测结果:
                  128k上下文 没有额外配置

                  最快30 tokens,最慢降速到十几tokens。均值26.2
                  这部分感觉优化空间很大,理论上ngram应该属于秒读不会影响模型速度,30tokens对于a6b有点不正常了。

                  另外补充:
                  这个模型的reasoning好像设置跟其他模型不太一样,想太多,设置一下应该会好很多。

                  J 离线
                  J 离线
                  johnnybegood
                  劳动模范 技术大牛
                  编写于 最后由 编辑
                  #8

                  @Gary-Pan 这么m5 max基本也就是3090的水平

                  terryT 1 条回复 最后回复
                  0
                  • J johnnybegood

                    @Gary-Pan 这么m5 max基本也就是3090的水平

                    terryT 离线
                    terryT 离线
                    terry
                    超级版主
                    编写于 最后由 编辑
                    #9

                    @johnnybegood 你想多了,3090还是更能打。

                    油管:https://www.youtube.com/@抡锤者

                    1 条回复 最后回复
                    0
                    • ,系统 取消固定了此主题

                    你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

                    厌倦了每次访问都刷到同样的帖子?您注册账号后,您每次返回时都能精准定位到您上次浏览的位置,并可选择接收新回复通知(通过邮件或推送通知)。您还能收藏书签、为帖子顶,向社区成员表达您的欣赏。

                    有了你的建议,这篇帖子会更精彩哦 💗

                    注册 登录
                    回复
                    • 在新帖中回复
                    登录后回复
                    • 从旧到新
                    • 从新到旧
                    • 最多赞同


                    • 登录

                    • 登录或注册以进行搜索。
                    • 第一个帖子
                      最后一个帖子
                    0
                    • 版块
                    • 最新
                    • 标签
                    • 热门
                    • 用户
                    • 群组