R9700 本地模型「智力」实测:35B MoE vs 27B dense,顺便跟云 API 比了下
Tags: r9700, rocm, llama.cpp, mtp, turboquant, 测评
前阵子跟风入了 AMD AI PRO R9700(32GB RDNA4),本地跑 LLM 速度是真滴爽:35B-A3B MoE 用 ATQ + MTP n=3 能到 ~98 tok/s,27B dense 也有 ~35 tok/s(35B pp ~2.5k,27B pp ~645, llama-benchy)。但速度爽归爽,一直好奇一个问题:本地这些小模型到底「聪明」不聪明?
于是让我的 Hermes Agent(Athena)写了个 10 题テスト集,把手上几个后端拉出来遛了遛。每个模型跑 3 次看一致性(重要,后面会说为什么)。
参戦选手
| 后端 | 模型 | active 参数 |
|---|---|---|
| 本地 | Qwen3.6-35B-A3B-MTP Q4_K_M | 3B |
| 本地 | Qwen3.6-27B-Q4_K_M-MTP | 27B dense |
| 云 | DeepSeek V4 Flash | 13B |
| 云 | Nemotron 3 Ultra 550B(OpenRouter 免费) | 55B |
结果(7 题自动评分 × 3 次)
| 模型 | 数学 | 逻辑 | 编程 | 平均/7 |
|---|---|---|---|---|
| 35B-A3B MoE | 0/6 | 5/6 | 6/6 | 4.3 |
| 27B dense | 1/6 | 5/6 | 6/6 | 4.7 |
| DeepSeek V4 Flash | 6/6 | 6/6 | 6/6 | 7.0 |
| Nemotron 3 Ultra | 6/6 | 6/6 | 6/6 | 7.0 |
说人话版结论
1. MoE 的 3B active 是数学硬伤
多步计算 3 次全错,每次错的还不一样(52/56/66)——典型小脑硬算。27B dense 稍好但也不稳。
2. 逻辑和编程,本地模型真不差
三段论、找 bug、括号平衡(7 个用例每次全过)——这些才是本地模型的得意分野,还快。
3. 数学/深度推理,老实交给云 API
DeepSeek 便宜,Nemotron 免费,12 次测试零失误。这点真没得比。
4. 单次测试会骗人
时钟夹角这种 borderline 题,35B 三次里对一次,27B 稳定答错 90°(正确 7.5°)。所以测模型还是要跑 3 次看一致性,一次的结果参考价值不大。
一句话总结: 本地跑模型图的是速度和无隐私顾虑,但复杂数学老实交给云 API。逻辑、代码、日常问答——本地完全够用,还快。
以上测试全部由 Hermes Agent Athena 自动执行(写测试 → 跑 3 次 → 入 SQLite → 出报告),人类只负责出题目和按按钮。这 workflow 挺好用的,有兴趣可以交流。