跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 AI 广场
  1. 主页
  2. 版块
  3. AI硬件
  4. 27B VS 35B VS 125B,新鲜出炉

27B VS 35B VS 125B,新鲜出炉

已定时 已固定 已锁定 已移动 AI硬件
qwen-27b量化
4 帖子 3 发布者 142 浏览
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • daniel zhouD 离线
    daniel zhouD 离线
    daniel zhou
    编写于 最后由 编辑
    #1

    结论:
    27B Qwen3.8-27B dense 首token 0.47s 30.4 tok/s 加载 14s
    35B Qwen3.6-35B A3B 首token 1.46s 25.1 tok/s 加载 10s
    125B Qwen3.8-Flash-Next A3B 首token 7.69s 8.4 tok/s 加载 18s

    配置:
    【27B】Qwen3.8-27B-Uncensored-Q4_K_M.gguf (16G, dense 密集模型)
    模型文件 : ~/models/Qwen3.8-27B-Uncensored-Q4_K_M.gguf
    量化 : Q4_K_M,dense(无 MoE,27B 参数全参与计算)
    端口 : 8081
    启动参数 :
    --host 0.0.0.0 --port 8081
    -m <模型路径>
    -ngl 999 # 全 GPU
    -c 262144 # 256K 上下文
    -b 2048 -ub 2048
    -fa on # flash attention
    -ctk q4_0 -ctv q4_0 # KV cache 量化
    --jinja --reasoning-preserve
    -np 1
    --threads 8 --threads-batch 44 # decode 8线程防超订,prefill 44线程
    (脚本: ~/qwen-server/start-27b.sh)

    【35B】Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-Q4_K_M.gguf (20G, MoE A3B)
    模型文件 : ~/models/qwen3.6-35b-uncensored/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-Q4_K_M.gguf
    量化 : Q4_K_M,MoE 35B 总参数 / 3B 激活
    端口 : 8084
    启动参数 :
    --host 0.0.0.0 --port 8084
    -m <模型路径>
    -ngl 999 # 所有层先映射 GPU
    -ncmoe 24 # 24 个 MoE 专家踢到 CPU 内存(省显存)
    -c 204800 # 200K 上下文
    -b 2048 -ub 2048
    -fa on
    -ctk q4_0 -ctv q4_0
    --jinja --reasoning-preserve
    -np 1
    --threads 44 --threads-batch 44
    (脚本: ~/qwen-server/start-35b-expert-offload.sh)

    【125B】Qwen3.8-Flash-Next-UD-Q4_K_XL (4 分片共 104G, MoE A3B/512专家)
    模型文件 : ~/models/Qwen3.8-Flash-Next/UD-Q4_K_XL/Qwen3.8-Flash-Next-UD-Q4_K_XL-00001-of-00004.gguf
    (-m 指向 00001,llama.cpp 自动识别同目录其余 3 片)
    量化 : UD-Q4_K_XL,实测总参数 176.94B / A3B 激活 / 512 专家
    端口 : 8085(无生产脚本,测试/对比时用)
    启动参数 :
    --host 127.0.0.1 --port 8085
    -m <00001-of-00004.gguf>
    -ngl 999
    -ncmoe 40 # 40 个专家走 CPU 内存(最优值,见下)
    -c 8192 # 测试用 8K,可按需调大
    -b 1024 -ub 1024
    -fa on
    -ctk q4_0 -ctv q4_0
    --jinja --reasoning-preserve
    -np 1
    --threads 44 --threads-batch 44

    1 条回复 最后回复
    0
    • W 离线
      W 离线
      weidong
      编写于 最后由 编辑
      #2

      用的啥硬件啊,125B这个速度是没法用了

      daniel zhouD 1 条回复 最后回复
      0
      • W weidong

        用的啥硬件啊,125B这个速度是没法用了

        daniel zhouD 离线
        daniel zhouD 离线
        daniel zhou
        编写于 最后由 编辑
        #3

        @weidong 128 d3+7900xtx

        1 条回复 最后回复
        0
        • terryT 在线
          terryT 在线
          terry
          超级版主
          编写于 最后由 编辑
          #4

          下次发帖的时候让AI整理下格式,太乱了。

          油管:https://www.youtube.com/@抡锤者

          1 条回复 最后回复
          0

          你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

          厌倦了每次访问都刷到同样的帖子?您注册账号后,您每次返回时都能精准定位到您上次浏览的位置,并可选择接收新回复通知(通过邮件或推送通知)。您还能收藏书签、为帖子顶,向社区成员表达您的欣赏。

          有了你的建议,这篇帖子会更精彩哦 💗

          注册 登录
          回复
          • 在新帖中回复
          登录后回复
          • 从旧到新
          • 从新到旧
          • 最多赞同


          • 登录

          • 登录或注册以进行搜索。
          • 第一个帖子
            最后一个帖子
          0
          • 版块
          • 最新
          • 标签
          • 热门
          • 用户
          • 群组