跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
折叠
品牌标识

抡锤者

A

Alan TANG

@Alan TANG
取消关注 关注
关于
帖子
1
主题
1
分享
0
群组
0
粉丝
0
关注
0

帖子

最新 最佳 有争议的

  • R9700 本地模型「智力」实测:35B MoE vs 27B dense,顺便跟云 API 比了下
    A Alan TANG

    R9700 本地模型「智力」实测:35B MoE vs 27B dense,顺便跟云 API 比了下

    Tags: r9700, rocm, llama.cpp, mtp, turboquant, 测评


    前阵子跟风入了 AMD AI PRO R9700(32GB RDNA4),本地跑 LLM 速度是真滴爽:35B-A3B MoE 用 ATQ + MTP n=3 能到 ~98 tok/s,27B dense 也有 ~35 tok/s(35B pp ~2.5k,27B pp ~645, llama-benchy)。但速度爽归爽,一直好奇一个问题:本地这些小模型到底「聪明」不聪明?

    于是让我的 Hermes Agent(Athena)写了个 10 题テスト集,把手上几个后端拉出来遛了遛。每个模型跑 3 次看一致性(重要,后面会说为什么)。

    参戦选手

    后端 模型 active 参数
    本地 Qwen3.6-35B-A3B-MTP Q4_K_M 3B
    本地 Qwen3.6-27B-Q4_K_M-MTP 27B dense
    云 DeepSeek V4 Flash 13B
    云 Nemotron 3 Ultra 550B(OpenRouter 免费) 55B

    结果(7 题自动评分 × 3 次)

    模型 数学 逻辑 编程 平均/7
    35B-A3B MoE 0/6 5/6 6/6 4.3
    27B dense 1/6 5/6 6/6 4.7
    DeepSeek V4 Flash 6/6 6/6 6/6 7.0
    Nemotron 3 Ultra 6/6 6/6 6/6 7.0

    说人话版结论

    1. MoE 的 3B active 是数学硬伤

    多步计算 3 次全错,每次错的还不一样(52/56/66)——典型小脑硬算。27B dense 稍好但也不稳。

    2. 逻辑和编程,本地模型真不差

    三段论、找 bug、括号平衡(7 个用例每次全过)——这些才是本地模型的得意分野,还快。

    3. 数学/深度推理,老实交给云 API

    DeepSeek 便宜,Nemotron 免费,12 次测试零失误。这点真没得比。

    4. 单次测试会骗人

    时钟夹角这种 borderline 题,35B 三次里对一次,27B 稳定答错 90°(正确 7.5°)。所以测模型还是要跑 3 次看一致性,一次的结果参考价值不大。


    一句话总结: 本地跑模型图的是速度和无隐私顾虑,但复杂数学老实交给云 API。逻辑、代码、日常问答——本地完全够用,还快。


    以上测试全部由 Hermes Agent Athena 自动执行(写测试 → 跑 3 次 → 入 SQLite → 出报告),人类只负责出题目和按按钮。这 workflow 挺好用的,有兴趣可以交流。

    LLM讨论区 本地模型 r9700
  • 登录

  • 没有帐号? 注册

  • 登录或注册以进行搜索。
  • 第一个帖子
    最后一个帖子
0
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组