[M5Max] vs [AI PRO 9700] 在 ubuntu 26/windows 11 上的性能对比,好像不折腾也能行?
-
[M5Max] vs [AI PRO 9700] 在 ubuntu 26/windows 11 上的性能对比,要不要折腾?
之前因为买错了 M5Max ,所以手里正好可以用来对比,然后最近看了抡锤者频道听到某期老特说 AI PRO 9700 就是他心中的白月光,于是心中起了邪念决定买回家好好玩弄一番,不是,是好好评测一番。
我个人这边主要的需求是编程,跟老特不太一样,我因为行业原因非常重视信息安全,不论是 llm wiki、memory 整理还是编程我都希望用本地模型解决,所以我的关注点主要在代码生成上。先说结论:
愿意折腾 Linux + AI PRO 9700 是不错的方案,不愿意折腾 Windows + AI PRO 9700 也完全能用。
评测标准我没有做到特别严谨,但是尽可能保证了两个最贴合日常使用的痛点:
- 尽可能不折腾,对的,你没看错,我想要的是玩 3D 打印而不是玩 3D 打印机,此处同理。
- 尽可能贴近日常使用,这里用了我最近偶然发现的 guidellm 这个测试工具。
guidellm 这个工具也顺便推荐一下,它是通过 api 去调用 llm 服务进行跑分,并且会持续一段时间,这段时间持续下来后会达到设备在功耗和性能上的平衡点,原理我也不是特别懂,但是看数据和我正常使用的情况下性能衰减到稳定状态时非常接近。很多新朋友可能不太理解的一点是常看的跑分数据可能需要 /2 才能获得真实场景下长时间运行时的性能,所以我这里使用的数据更加接近真实使用时的感受。但是还是请注意,这个评测不保证绝对的严谨。
qwen3.5-9b 并发评测
这里我先用了 qwen3.5-9b 模型来做性能对比,主要原因是这个模型比较小,能够测试并发,实际用 AI Agent 做过开发的朋友应该都会有一个感受,一旦开始利用 AI 开发,“你”就是最后的瓶颈,怎么优化掉“你”就是这个系统里面性能优化的关键。目前比较前沿的实践就是通过 AI Agent 团队来解决这个问题,所以本地能够比较好的支持并发也是非常有意义的。接下来先看跑分图(所有跑分都是取第二次运行,已经确保预热过后的分数):
M5Max + oMLX + lmstudio-community/Qwen3.5-9B-MLX-4bit
这里做一个简单的说明,如果只关心吞吐,那么可以看图片底部的
Server Throughput Statistics,其中Input Token Per Sec就是 Prefill 速度,Output Token Per Sec就是生成速度。9b 的测试数据都有 3 组,依次代表 1、2、4 并发下的性能。
Mac 上 MLX 模型有特别的优化,并且 oMLX 的使用也是非常简单,不需要任何命令行操作只要理解模型的参数设置即可获得不错的性能,所以这里采用了 oMLX + lmstudio-community/Qwen3.5-9B-MLX-4bit 的组合。
Ubuntu Server 26.04 + AI PRO 9700 + llama.cpp latest + unsloth/Qwen3.5-9B-Q4_K_M

Ubuntu 仍然是最折腾的环境,小白劝退,但是评测看到最后你会发现就算 Windows 也不用眼红。
Windows 11 + AI PRO 9700 + lmstudio + ROCm latest runtime + unsloth/Qwen3.5-9B-Q4_K_M

Windows 上 lmstudio 是当之无愧的最简单运行环境,我最开始只有 RTX4070 的时候就是用这个软件先开始尝试了一下本地翻译模型,理解了其实用价值。唯一的使用门槛就在于你的网络环境和理解模型参数上。
Windows 11 + AI PRO 9700 + lmstudio + Vulkan latest runtime + unsloth/Qwen3.5-9B-Q4_K_M

由于看国外大神的评测发现 ROCm 和 Vulkan 的性能会有差距,而且在 lmstudio 里面点点鼠标就能更换,所以我这里就多测了一种运行环境。本来说实话是感觉有点浪费时间的,但是不要走开看到后面你就懂了。
qwen3.6-27b 评测
然后我用了实际工作中发现最稳定的模型 qwen3.6-27b 来进行测试,这个模型和 35B-A3B 之间的讨论很多,不过碍于篇幅,我这里就不展开了。总之它很具有代表性,这个模型能跑得快,那么 35B-A3B 模型可以预期有 2.5~3 倍的速度提升。
M5Max + oMLX + Jundot/Qwen3.6-27B-oQ4e-mtp

初看感觉是慢,实际使用体验是真慢。所以后来我还是入了 AI PRO 9700 ,因为实际使用中这台设备一旦负责翻译、llm wiki 索引等工作,偶尔再来一个 coding 任务就会慢上加慢。但是好吧这类设备也有一个得天独厚的优势,就是可以通过 ds4 这个项目跑起来 deepseek v4 flash ,知识面是非常齐全的。
Ubuntu Server 26.04 + AI PRO 9700 + llama.cpp latest + unsloth/Qwen3.6-27B-MTP-GGUF/Qwen3.6-27B-MTP-Q5_K_M

看到这里相信大部分朋友已经感受到了 AI PRO 9700 的舒适感,我稍微想要补充一下的是,我这两天发现单 AI PRO 9700 最大的问题就是没有更多的显存去开并发。32GB 显存如果跑 Qwen3.6-27B-Q5_K_M 就要占用 19GB ,想开并发并非不可能但是单个我也只敢开 160KB 的 context ,所以更不推荐并发了。
Windows 11 + AI PRO 9700 + lmstudio + ROCm latest runtime + unsloth/Qwen3.6-27B-MTP-GGUF/Qwen3.6-27B-MTP-Q5_K_M

Windows 11 + AI PRO 9700 + lmstudio + Vulkan latest runtime + unsloth/Qwen3.6-27B-MTP-GGUF/Qwen3.6-27B-MTP-Q5_K_M

这张图中的结果非常让我意外,后来我又尝试了多次,基本就在这个结果附近波动。lmstudio 上使用 Vulkan latest runtime 运行 qwen3.6-27b 不需要任何折腾,然后你就可以获得一个十分不错的性能。
下面是 AI 的总结:

好了,希望对于最后坚持到这里的各位这些跑分能够帮助到一些现在还在观望等待的朋友,对于现在的显卡价格我也是无力吐槽的,只能祝愿大家都能早日把老特的白月光抱回家好好享用一番。老特这方面的品味确实不错

最后附上用的命令:
# 跑 9b 的命令 guidellm run \ --backend kind=openai_http,target=http://192.168.50.x:8000,model=qwen3.6-9b-q4 \ --tokenizer kind=huggingface_auto,model=unsloth/Qwen3.5-9B \ --profile '{"kind":"concurrent","streams":[1,2,4]}' \ --constraint kind=max_duration,seconds=60 \ --data kind=synthetic_text,prompt_tokens=1280,output_tokens=280 # 跑 27b 的命令 guidellm run \ --backend kind=openai_http,target=http://192.168.50.x:8000,model=qwen3.6-27b-q5 \ --tokenizer kind=huggingface_auto,model=unsloth/Qwen3.6-27B \ --profile '{"kind":"concurrent","streams":[1]}' \ --constraint kind=max_duration,seconds=60 \ --data kind=synthetic_text,prompt_tokens=1280,output_tokens=280 -
T terry 于 将此主题固定
-
系统 于 取消固定此主题