跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 AI 广场
  1. 主页
  2. 版块
  3. LLM讨论区
  4. Qwen3.8 27B M5 Max

Qwen3.8 27B M5 Max

已定时 已固定 已锁定 已移动 LLM讨论区
qwen-27bmac
4 帖子 3 发布者 224 浏览
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • Fang LiuF 离线
    Fang LiuF 离线
    Fang Liu
    编写于 最后由 编辑
    #1

    我下载了全精度权重用 oMLX 转换成了 oQ4e 量化,保留 MTP
    https://huggingface.co/fevaoctwh/Qwen3.8-27B-oQ4e-mtp
    在 M5 Max平台上可以说是精度和速度的一个平衡吧,更高的量化,M5 Max 就受限于内存带宽,decode 速度完全上不去了

    Measured with the built-in oMLX benchmark (/admin dashboard), single-request mode:

    • Engine: Auto
    • Context: Code (Python)
    • Test pattern: pp<T> / tg128 = prefill T tokens, then generate 128 tokens
    • Hardware: Apple Silicon (M5 Max, 128 GB unified memory)
    Test TTFT (ms) TPOT (ms) Prefill (tok/s) Generation (tok/s) E2E (s) Throughput (tok/s) Peak Mem
    pp1024 / tg128 1161.5 15.84 881.6 63.6 3.184 361.9 16.72 GB
    pp4096 / tg128 5155.9 19.23 794.4 52.4 7.614 554.8 18.19 GB
    pp8192 / tg128 11856.7 18.13 690.9 55.6 14.176 586.9 19.24 GB
    pp16384 / tg128 25982.8 17.80 630.6 56.6 28.260 584.3 20.78 GB

    量化后的能力肯定是打折的,作为 Agent 本地对话模型和简单任务是完全够用了,我现在使用的是Qwen3.6-35B-A3B-oQ6e
    M 芯片目前的架构还是适合激活参数小的 MoE, 甜点尺寸应该是 100B 左右总参数量但是激活小于 10B 参数的模型

    Model Type Released MMLU-Pro LiveCodeBench v6 SWE-bench Verified
    Qwen3.8-27B-oQ4e-mtp (this model) Quantized 4/5-bit MLX, 27B dense Aug 2026 80.7% * — (not run) —
    Qwen3.6-27B Non-quantized, 27B dense Apr 2026 86.2% ~83.9 77.2%
    Qwen3.6-35B-A3B Non-quantized, 35B MoE Apr 2026 85.2% 80.4 73.4%
    Gemma 4 31B Non-quantized, 31B dense Mar 2026 85.2% 80.0 52.0%

    LiveCodeBench v6 还在跑 27/300…… 结果要明天了

    Tony WangT 1 条回复 最后回复
    2
    • terryT 离线
      terryT 离线
      terry
      超级版主
      编写于 最后由 编辑
      #2

      苹果平台还是老实用Moe吧。

      油管:https://www.youtube.com/@抡锤者

      1 条回复 最后回复
      0
      • Fang LiuF Fang Liu

        我下载了全精度权重用 oMLX 转换成了 oQ4e 量化,保留 MTP
        https://huggingface.co/fevaoctwh/Qwen3.8-27B-oQ4e-mtp
        在 M5 Max平台上可以说是精度和速度的一个平衡吧,更高的量化,M5 Max 就受限于内存带宽,decode 速度完全上不去了

        Measured with the built-in oMLX benchmark (/admin dashboard), single-request mode:

        • Engine: Auto
        • Context: Code (Python)
        • Test pattern: pp<T> / tg128 = prefill T tokens, then generate 128 tokens
        • Hardware: Apple Silicon (M5 Max, 128 GB unified memory)
        Test TTFT (ms) TPOT (ms) Prefill (tok/s) Generation (tok/s) E2E (s) Throughput (tok/s) Peak Mem
        pp1024 / tg128 1161.5 15.84 881.6 63.6 3.184 361.9 16.72 GB
        pp4096 / tg128 5155.9 19.23 794.4 52.4 7.614 554.8 18.19 GB
        pp8192 / tg128 11856.7 18.13 690.9 55.6 14.176 586.9 19.24 GB
        pp16384 / tg128 25982.8 17.80 630.6 56.6 28.260 584.3 20.78 GB

        量化后的能力肯定是打折的,作为 Agent 本地对话模型和简单任务是完全够用了,我现在使用的是Qwen3.6-35B-A3B-oQ6e
        M 芯片目前的架构还是适合激活参数小的 MoE, 甜点尺寸应该是 100B 左右总参数量但是激活小于 10B 参数的模型

        Model Type Released MMLU-Pro LiveCodeBench v6 SWE-bench Verified
        Qwen3.8-27B-oQ4e-mtp (this model) Quantized 4/5-bit MLX, 27B dense Aug 2026 80.7% * — (not run) —
        Qwen3.6-27B Non-quantized, 27B dense Apr 2026 86.2% ~83.9 77.2%
        Qwen3.6-35B-A3B Non-quantized, 35B MoE Apr 2026 85.2% 80.4 73.4%
        Gemma 4 31B Non-quantized, 31B dense Mar 2026 85.2% 80.0 52.0%

        LiveCodeBench v6 还在跑 27/300…… 结果要明天了

        Tony WangT 在线
        Tony WangT 在线
        Tony Wang
        超级版主
        编写于 最后由 Tony Wang 编辑
        #3

        @Fang-Liu

        这个速度已经相当惊人了. 我的M5pro, oMlx, 4bit量化, 也就在 17-20出点儿头. 好像当时也是MTP的模型

        你这个50-60的decode速度, 已经完全够用了. prefill 大几百, 稍微慢些, 但是也肯定够用.

        比我想象中的好多了. 👍 👍 👍

        1 条回复 最后回复
        0
        • Tony WangT 在线
          Tony WangT 在线
          Tony Wang
          超级版主
          编写于 最后由 编辑
          #4

          我找了一下, 我是 5月19日测试的, Qwen 3.6 27B oQ4.

          今天oMLX发布了 0.3.9rc1, 支持了 native MTP, 我又测了一下加上了MTP机制的 27b oQ4, decode 明显提升, PP 基本不变.

          ad072ce5-9cd4-438d-983f-7117ed48cfb9.png

          1 条回复 最后回复
          1

          你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

          厌倦了每次访问都刷到同样的帖子?您注册账号后,您每次返回时都能精准定位到您上次浏览的位置,并可选择接收新回复通知(通过邮件或推送通知)。您还能收藏书签、为帖子顶,向社区成员表达您的欣赏。

          有了你的建议,这篇帖子会更精彩哦 💗

          注册 登录
          回复
          • 在新帖中回复
          登录后回复
          • 从旧到新
          • 从新到旧
          • 最多赞同


          • 登录

          • 登录或注册以进行搜索。
          • 第一个帖子
            最后一个帖子
          0
          • 版块
          • 最新
          • 标签
          • 热门
          • 用户
          • 群组