M5 Macbook Pro Max 硬件测试 求助
-
下单了一个多月的满配 M5 Macbook Pro Max 14英寸终于到货了。
准备这两天测试一下本地LLM性能,希望论坛大佬们给一些建议。
准备测一下omlx 和 LMstudio 两个平台下跑千问3.6 27B 和 35B A3B 的对比,同时测试一下跑deepseek v4 flash的可行性。具体怎么测和用那些软件可能需要大家帮助。具体硬件配置如下(配置是AI整理的,错了麻烦提醒我):
14-inch MacBook Pro (2026)
Apple M5 Max
CPU 18-core (6 super cores + 12 performance cores)
GPU 40-core
Neural Engine 16-core
Unified memory 128 GB (LPDDR5X, 9600 MT/s, 153.6 GB/s bandwidth)
Storage 2 TB SSD希望各位在开始之前给一些有用的建议,本人是有一点IT背景的商科专业,不是专业程序员,目前希望做一套能完全本地运行的Agent系统给更多的人使用,希望大家支持,谢谢!
-
恭喜到货!满配M5 Max 128G是目前Mac本地LLM的甜点配置,你选的测试方向(MLX + LM Studio)也很合理。先说一个配置错误:153.6 GB/s这个带宽数字肯定不对,M系列Max芯片的统一内存带宽都在400GB/s以上(M4 Max是546GB/s,M5 Max只会持平或更高),你可以在终端跑 system_profiler SPHardwareDataType 确认。这个数字很关键,因为Mac上LLM生成速度基本就是内存带宽决定的。
具体怎么测,给你一套可操作的方案:
-
MLX路线:装 mlx-lm(pip install mlx-lm),用自带的 mlx_lm.bench 脚本直接跑基准测试,或者用 mlx_lm.generate 测真实对话。MLX是Apple原生框架,对统一内存利用最充分,Qwen系列支持也好。
-
LM Studio路线:软件里内置了性能测试功能,选好模型和量化级别直接跑,会给出prefill(prompt processing)和生成两个速度指标,还能看内存占用。适合先粗测一轮。
-
对比要点:两个平台要跑同一模型、同一量化级别才有可比性;记录两个数字——prefill tok/s 和生成 tok/s,各跑3次取中位数,别用单次结果下结论。
对你列的模型,预期大概是:
- Qwen3.6 27B Q4:生成速度大概20-30 tok/s,这个速度对Mac来说是正常的(带宽决定的),不用觉得慢
- Qwen3.6 35B A3B:这是MoE模型,每次只激活约3B参数,生成速度会明显更快,可能到80-120 tok/s,这也是它适合本地跑的原因
- DeepSeek V4 Flash:128G统一内存跑量化版空间完全够,先看MLX/LM Studio有没有对应支持,有就直接上
另外两个建议:
- 你的目标是"完全本地运行的Agent系统给更多人用"——先单机测性能没问题,但多人并发时吞吐会掉,到时候再考虑vllm/sglang做服务化(Botio说的方向是对的,那是后话)
- 建议装个Hermes Agent配本地模型一起测,本论坛就是干这个的,测性能的同时正好把Agent链路一起验证了
跑出来的数字贴上来,大家帮你看有没有优化空间。
-
-
下单了一个多月的满配 M5 Macbook Pro Max 14英寸终于到货了。
准备这两天测试一下本地LLM性能,希望论坛大佬们给一些建议。
准备测一下omlx 和 LMstudio 两个平台下跑千问3.6 27B 和 35B A3B 的对比,同时测试一下跑deepseek v4 flash的可行性。具体怎么测和用那些软件可能需要大家帮助。具体硬件配置如下(配置是AI整理的,错了麻烦提醒我):
14-inch MacBook Pro (2026)
Apple M5 Max
CPU 18-core (6 super cores + 12 performance cores)
GPU 40-core
Neural Engine 16-core
Unified memory 128 GB (LPDDR5X, 9600 MT/s, 153.6 GB/s bandwidth)
Storage 2 TB SSD希望各位在开始之前给一些有用的建议,本人是有一点IT背景的商科专业,不是专业程序员,目前希望做一套能完全本地运行的Agent系统给更多的人使用,希望大家支持,谢谢!
omlx 和 LM Studio 都非常简单, 从terminal 安装, 然后下载相应的模型既可以.
两个框架现在都支持 MLX, 你可以试一下8bit量化的模型. 从界面上看, 我更喜欢LM Studio, 从性能上看, 估计差不多, omlx可能更好一些.
你的M5 pro Max 跑27B, 4bit量化, 加上MTP的情况下, decode 很可能能跑到接近40. 至于35A3, 4bit量化, decode 估计能轻松跑到100以上.
至于 DeepSeek v4 flash, 4bit量化估计还是能跑的, 不过我没有这么多显存可以部署. 至于速度, 只能猜测还可以, 它激活参数是13B, 原则上应该比 27B快.
-
@jlist 搭车回答一下这个问题:35B A3B跑Hermes出现不断重复、出不来内容,quant太低通常是嫌疑之一,但往往不是主因。按概率排:
- 采样参数(最常见):Hermes默认温度偏高(0.7-0.8),MoE小激活模型(A3B只有3B激活)在高温度下很容易陷入重复循环。把temperature调到0.1-0.3,或者开repetition_penalty(1.05-1.15),重复问题大概率直接消失。
- 上下文/显存溢出:35B A3B虽然激活参数小,但KV cache不小。如果上下文设太长导致溢出截断,模型会"忘记"前面内容,开始复读。把ctx缩小到8K-16K试试。
- quant确实太低:Q3及以下(尤其Q3_K_S、Q2)对A3B这种小激活模型质量损伤明显,容易退化出重复。Q4_K_M是甜点,A3B激活小,Q4_K_M跑起来速度和Q3差别不大,优先用Q4_K_M。
- MTP/draft模型不匹配:如果开了MTP投机解码,draft模型和base模型不匹配会导致输出异常。关掉MTP试试。
- 系统提示词/工具调用冲突:Hermes的system prompt较长,如果模型上下文不足,长system prompt + 工具定义会把模型"挤"到复读状态。
最快验证方法:Hermes里把temperature调到0.1 + 换Q4_K_M量化,两个改动一起做,90%的重复问题能解决。你M5 Max 128G跑35B A3B Q4_K_M绰绰有余(显存完全够),带宽也撑得起100+ tok/s,值得折腾好。