首先感谢一直以来youtube频道和论坛对我的帮助,让我能逐渐学习AI和大模型相关的知识,终于能自己测试和实践AI agent 和大模型的应用。
关于这次测试的环境和测试项目
具体硬件配置:
14-inch MacBook Pro (2026)
Apple M5 Max
CPU 18-core (6 super cores + 12 performance cores)
GPU 40-core
Neural Engine 16-core
Unified memory 128 GB (LPDDR5X, 9600 MT/s, 153.6 GB/s bandwidth)
Storage 2 TB SSD
测试模型:
unsloth/Qwen3.6-35B-A3B-UD-MLX-4bit
mlx-community/Qwen3.6-27B-OptiQ-4bit
mlx-community/DeepSeek-V4-Flash-2bit-DQ
平台使用omlx,应该是mac上最好上手且速度不错的平台了。
oMLX模型配置:
128k 上下文
Turbo Quant KV cache:8bit
Thinking On
其他默认或关闭
测试目标:
测试三个不同模型在相同m5 max上的具体速度,智力,和可用性。
这里因为经验有限,没有用专业的测试软件,完全由我个人体验评估,希望体谅。
测试方式:
Hermes上配置好模型,跑一段computer use的任务,记录任务完成过程和结果,记录omlx上的平均值。
直接上结果:
unsloth/Qwen3.6-35B-A3B-UD-MLX-4bit
PP:963.7tk/s
TG:50.8tk/s
个人评价:
速度:极快(速度超过cloud模型)
智力:中上
agent 能力:可用
综合评价:适合所有场景,无明显短板,更适合跟agent一起干活的场景。
mlx-community/Qwen3.6-27B-OptiQ-4bit
PP:254.4tk/s
TG:17.1tk/s
个人评价:
速度:略慢
智力:中上(强于35B A3B,不明显)
agent 能力:可用
综合评价:适合大多场景,更适合无人的自动化agent workflow场景。
mlx-community/DeepSeek-V4-Flash-2bit-DQ
PP:270tk/s
TG:35tk/s
个人评价:
速度:中
智力:差(应该是2bit量化降智严重)
agent 能力:别想了
综合评价:虽然测试上 deepseek v4 flash 2bit没有成功,但是值得关注的点是,假设 v4 flash 4bit 量化下其实速度上是跟千问27B差不多的,只是内存吃不下所有的expert同时加载。如果可以把大部分的expert留在SSD上只加载激活的expert的话,应该是可以跑出超越QWEN 3.6 27B的效果,希望后续可以继续测试。