跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 AI 广场
  1. 主页
  2. 版块
  3. LLM讨论区
  4. 【最强 35B MoE 模型】Qwen3.8‑35B‑A3B‑Distill‑GGUF

【最强 35B MoE 模型】Qwen3.8‑35B‑A3B‑Distill‑GGUF

已定时 已固定 已锁定 已移动 LLM讨论区
qwenllama.cpp量化
8 帖子 6 发布者 351 浏览 2 关注中
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • P
    P
    perter
    编写于 最后由 perter 编辑
    #1

    🌟 模型简介

    首先申明Qwen3.8‑35B‑A3B‑Distill‑GGUF不是Qwen官方发布的模型, 是Empero将 Qwen3.8 前沿模型蒸馏到 Qwen3.6‑35B‑A3B 的 Mixture‑of‑Experts(MoE)架构版本,提供多种 GGUF 量化文件,可直接用于 llama.cpp、Ollama、LM Studio、Jan、KoboldCpp 等推理框架。

    模型特点:

    • 35B 总参数
    • 每 token 仅激活约 3B 参数(MoE 稀疏)
    • 推理速度显著快于同体量稠密模型

    🧠 架构细节

    • 30 层 Gated DeltaNet
    • 10 层 全注意力层
    • 256 个专家,每 token 路由 8 个专家

    ⚠️ 使用前注意

    加载此模型需要 支持 Qwen3.6 / Gated DeltaNet MoE 的新版 llama.cpp。
    旧版本会直接加载失败。


    📦 GGUF 文件列表(量化方式与大小)

    文件名 量化 大小 说明
    IQ2_M 12.558 GB 最小可用,16GB 显卡可跑
    Q2_K 13.839 GB 2-bit K-quant,兼容性好
    IQ3_M 16.340 GB 3-bit,高性价比
    Q3_K_M 17.664 GB 常规 3-bit K-quant
    IQ4_XS 19.628 GB 接近 Q4_K_M,体积更小
    Q4_K_M(推荐) 21.713 GB 质量与体积最佳平衡
    Q5_K_M 25.348 GB 更高质量
    Q6_K 29.209 GB 接近无损
    Q8_0 37.802 GB 最高质量量化
    BF16 71.067 GB 全精度参考版
    Vision Projector 0.899 GB 图像输入需要搭配此文件

    💻 VRAM / RAM 需求指南

    量化 GPU VRAM CPU RAM
    IQ2_M / Q2_K 16GB 16GB
    IQ3_M / Q3_K_M 20–24GB 24GB
    IQ4_XS / Q4_K_M 24GB 32GB
    Q5_K_M / Q6_K 32GB 48GB
    Q8_0 48GB 64GB
    BF16 80GB+ 96GB

    MoE 架构让 CPU 推理比稠密模型更可行。


    🛠 推理示例(llama.cpp)

    文本推理

    llama-cli -m Qwen3.8-35B-A3B-Q4_K_M.gguf \
      --temp 0.6 --top-p 0.95 --top-k 20 \
      -n 16384 -cnv
    

    模型属于 推理模型(reasoning model),回答开头会带结构化块,需要在最终输出中清理掉。


    图像推理(Vision)

    llama-mtmd-cli \
      -m Qwen3.8-35B-A3B-Q4_K_M.gguf \
      --mmproj mmproj-Qwen3.8-35B-A3B-F16.gguf \
      --image photo.jpg \
      -p "Describe this image."
    

    视觉模型来自 Qwen3.6‑35B‑A3B,蒸馏过程未评估视觉能力。


    🧩 Ollama / LM Studio / Jan / KoboldCpp

    直接加载 GGUF 文件即可,聊天模板已内置。
    推荐采样参数:temperature=0.6, top_p=0.95, top_k=20


    🔐 校验下载

    下载地址:Qwen3.8-35B-A3B-Distill-GGUF

    sha256sum -c SHA256SUMS --ignore-missing
    

    📜 许可

    模型权重使用 Apache‑2.0 许可。


    1 条回复 最后回复
    2
    • kos orK
      kos orK
      kos or
      超凡大师
      编写于 最后由 编辑
      #2

      35B-A3B 的"速度" 是最適合本地Agent使用, 希望它的品質能盡快達到可用的程度, 操作會非常流暢, 會類似 5090 跑 Qwen3.8-27B的體感

      1 条回复 最后回复
      0
      • K
        K
        koala
        德高望重 劳动模范
        编写于 最后由 编辑
        #3

        楼主有测试跑的速度如何吗?

        1 条回复 最后回复
        0
        • P
          P
          perter
          编写于 最后由 编辑
          #4

          @koala 大约比Qwen3.8-27B快一倍,开MTP差不多70token/s

          1 条回复 最后回复
          0
          • PENG XUP
            PENG XUP
            PENG XU
            编写于 最后由 编辑
            #5

            看来是刚出来的35B 新产品

            1 条回复 最后回复
            0
            • M
              M
              marsempire
              编写于 最后由 编辑
              #6

              和qwen3.8-27b相比,这个是不是代码水平不如27b,更适合写文章?
              习惯用无审查版,等无审查版的……

              P 1 条回复 最后回复
              0
              • M marsempire

                和qwen3.8-27b相比,这个是不是代码水平不如27b,更适合写文章?
                习惯用无审查版,等无审查版的……

                P
                P
                perter
                编写于 最后由 编辑
                #7

                @marsempire 我的测试中和qwen3.8-27b相比代码水平互有胜负,qwen3.8-27b写的游戏往往第一次都会卡在启动画面,Qwen3.8‑35B写的游戏都是一次启动成功。肯定比Qwen3.6‑35B和Ornith-35B的代码水平强的多。无审查版我还是用Qwen3.6‑35B。

                1 条回复 最后回复
                0
                • stxpnetS
                  stxpnetS
                  stxpnet
                  超凡大师
                  编写于 最后由 编辑
                  #8

                  谢谢楼主,我下载了,试一下跑手写

                  报表识别效果如果,我之前的SGLANG 35B跑报表,有些细节老是识别不到

                  双卡3090 PCIE 3.0 8X/8X

                  白天(宰相) Sglang+mattbucci 3.6 35B A3B AWQ W4A16 262K ~160 t/s
                  夜间(将军) sglang+DENSE 27B INT8-W8A8-imatrix mtp/dflash2 230K ~65 t/s
                  1 条回复 最后回复
                  0

                  你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

                  厌倦了每次访问都刷到同样的帖子?您注册账号后,您下次访问时都将自动回到上次浏览的位置,并可选择接收新回复的通知(通过电子邮件或推送通知)。您还可以收藏帖子、为帖子点赞,以此向其他社区成员表达您的感谢。

                  有了你的建议,这篇帖子会更精彩哦 💗

                  注册 登录
                  回复
                  • 在新帖中回复
                  登录后回复
                  • 从旧到新
                  • 从新到旧
                  • 最多赞同


                  • 登录

                  • 登录或注册以进行搜索。
                  • 第一个帖子
                    最后一个帖子
                  0
                  • 版块
                  • 最新
                  • 标签
                  • 热门
                  • 用户
                  • 群组