M5 Max Macbook Pro Hermes环境 硬件测试
-
首先感谢一直以来youtube频道和论坛对我的帮助,让我能逐渐学习AI和大模型相关的知识,终于能自己测试和实践AI agent 和大模型的应用。
关于这次测试的环境和测试项目
具体硬件配置:
14-inch MacBook Pro (2026)
Apple M5 Max
CPU 18-core (6 super cores + 12 performance cores)
GPU 40-core
Neural Engine 16-core
Unified memory 128 GB (LPDDR5X, 9600 MT/s, 153.6 GB/s bandwidth)
Storage 2 TB SSD测试模型:
unsloth/Qwen3.6-35B-A3B-UD-MLX-4bit
mlx-community/Qwen3.6-27B-OptiQ-4bit
mlx-community/DeepSeek-V4-Flash-2bit-DQ平台使用omlx,应该是mac上最好上手且速度不错的平台了。
oMLX模型配置:
128k 上下文
Turbo Quant KV cache:8bit
Thinking On
其他默认或关闭测试目标:
测试三个不同模型在相同m5 max上的具体速度,智力,和可用性。
这里因为经验有限,没有用专业的测试软件,完全由我个人体验评估,希望体谅。测试方式:
Hermes上配置好模型,跑一段computer use的任务,记录任务完成过程和结果,记录omlx上的平均值。直接上结果:
unsloth/Qwen3.6-35B-A3B-UD-MLX-4bitPP:963.7tk/s
TG:50.8tk/s个人评价:
速度:极快(速度超过cloud模型)
智力:中上
agent 能力:可用
综合评价:适合所有场景,无明显短板,更适合跟agent一起干活的场景。mlx-community/Qwen3.6-27B-OptiQ-4bit
PP:254.4tk/s
TG:17.1tk/s个人评价:
速度:略慢
智力:中上(强于35B A3B,不明显)
agent 能力:可用
综合评价:适合大多场景,更适合无人的自动化agent workflow场景。mlx-community/DeepSeek-V4-Flash-2bit-DQ
PP:270tk/s
TG:35tk/s个人评价:
速度:中
智力:差(应该是2bit量化降智严重)
agent 能力:别想了
综合评价:虽然测试上 deepseek v4 flash 2bit没有成功,但是值得关注的点是,假设 v4 flash 4bit 量化下其实速度上是跟千问27B差不多的,只是内存吃不下所有的expert同时加载。如果可以把大部分的expert留在SSD上只加载激活的expert的话,应该是可以跑出超越QWEN 3.6 27B的效果,希望后续可以继续测试。 -
Gary Pan 这个对比测试做得挺扎实,同一环境三个模型一起跑,比单独晒跑分有参考价值得多。补充几点:
-
35B A3B 的 PP 963tk/s 是 MoE 只激活 3B 的账面数字,实际体感看 TG 50.8tk/s——这已经接近 MLX 在这台机器上的内存带宽上限(153.6GB/s),想再快只能靠更小的量化或更短上下文。
-
terry 说的 27B dense 在 Agent 场景更稳,我实测也认同:A3B 这类 MoE 在长工具调用链里更容易跑偏,dense 模型执行多步任务时更不容易走样。你"35B 适合跟 agent 一起干活、27B 适合无人自动化"的结论方向是对的。
-
关于 V4 Flash 2bit 降智——2bit 是激进量化,智力崩是预期内,不代表模型本身不行。你说的"expert 留 SSD 只加载激活部分"在桌面侧是现成能力:llama.cpp 有 --cpu-moe 可以把 expert 张量放 CPU 侧,vLLM 有 --expert-offload 做 MoE 卸载;MLX 目前没有内置 expert 卸载,但 macOS 统一内存本身会被系统换页到 SSD,某种意义上已经在自动"借"SSD,只是不可控。另外 4bit 全量在你的 128G 上未必装不下,值得先直接试一次完整加载,跑不动再上 offload 方案。
-
想给"智力"维度补点客观数据,可以挑几道带工具调用的标准任务固定跑一遍;你的第一轮个人体验评估已经很够参考了。
-
-
DeepSeek-V4-Flash-3bit 你应该也能装上。试试3吧