【最强 35B MoE 模型】Qwen3.8‑35B‑A3B‑Distill‑GGUF
-
模型简介首先申明Qwen3.8‑35B‑A3B‑Distill‑GGUF不是Qwen官方发布的模型, 是Empero将 Qwen3.8 前沿模型蒸馏到 Qwen3.6‑35B‑A3B 的 Mixture‑of‑Experts(MoE)架构版本,提供多种 GGUF 量化文件,可直接用于 llama.cpp、Ollama、LM Studio、Jan、KoboldCpp 等推理框架。
模型特点:
- 35B 总参数
- 每 token 仅激活约 3B 参数(MoE 稀疏)
- 推理速度显著快于同体量稠密模型
🧠 架构细节
- 30 层 Gated DeltaNet
- 10 层 全注意力层
- 256 个专家,每 token 路由 8 个专家
️ 使用前注意加载此模型需要 支持 Qwen3.6 / Gated DeltaNet MoE 的新版 llama.cpp。
旧版本会直接加载失败。
GGUF 文件列表(量化方式与大小)文件名 量化 大小 说明 IQ2_M 12.558 GB 最小可用,16GB 显卡可跑 Q2_K 13.839 GB 2-bit K-quant,兼容性好 IQ3_M 16.340 GB 3-bit,高性价比 Q3_K_M 17.664 GB 常规 3-bit K-quant IQ4_XS 19.628 GB 接近 Q4_K_M,体积更小 Q4_K_M(推荐) 21.713 GB 质量与体积最佳平衡 Q5_K_M 25.348 GB 更高质量 Q6_K 29.209 GB 接近无损 Q8_0 37.802 GB 最高质量量化 BF16 71.067 GB 全精度参考版 Vision Projector 0.899 GB 图像输入需要搭配此文件
VRAM / RAM 需求指南量化 GPU VRAM CPU RAM IQ2_M / Q2_K 16GB 16GB IQ3_M / Q3_K_M 20–24GB 24GB IQ4_XS / Q4_K_M 24GB 32GB Q5_K_M / Q6_K 32GB 48GB Q8_0 48GB 64GB BF16 80GB+ 96GB MoE 架构让 CPU 推理比稠密模型更可行。
推理示例(llama.cpp)文本推理
llama-cli -m Qwen3.8-35B-A3B-Q4_K_M.gguf \ --temp 0.6 --top-p 0.95 --top-k 20 \ -n 16384 -cnv模型属于 推理模型(reasoning model),回答开头会带结构化块,需要在最终输出中清理掉。
图像推理(Vision)
llama-mtmd-cli \ -m Qwen3.8-35B-A3B-Q4_K_M.gguf \ --mmproj mmproj-Qwen3.8-35B-A3B-F16.gguf \ --image photo.jpg \ -p "Describe this image."视觉模型来自 Qwen3.6‑35B‑A3B,蒸馏过程未评估视觉能力。
🧩 Ollama / LM Studio / Jan / KoboldCpp
直接加载 GGUF 文件即可,聊天模板已内置。
推荐采样参数:temperature=0.6, top_p=0.95, top_k=20
校验下载下载地址:Qwen3.8-35B-A3B-Distill-GGUF
sha256sum -c SHA256SUMS --ignore-missing
许可模型权重使用 Apache‑2.0 许可。
-
和qwen3.8-27b相比,这个是不是代码水平不如27b,更适合写文章?
习惯用无审查版,等无审查版的…… -
和qwen3.8-27b相比,这个是不是代码水平不如27b,更适合写文章?
习惯用无审查版,等无审查版的……@marsempire 我的测试中和qwen3.8-27b相比代码水平互有胜负,qwen3.8-27b写的游戏往往第一次都会卡在启动画面,Qwen3.8‑35B写的游戏都是一次启动成功。肯定比Qwen3.6‑35B和Ornith-35B的代码水平强的多。无审查版我还是用Qwen3.6‑35B。