接着测试 oMLX with Qwen3.8-35B-A3B-Distill-oQ8-fp16-mtp(38.6G)
(oMLX上没找到35B-A3B 4Bit的mtp模型)

A3B模型性能更好了,缺点是因为Q8占内存更高,上下文128K以上就压力太大了。
智力测试与27B(Q4)对比:

除了LIVECODEBENCH 低了不少,其余测试似乎和4Bit 27B不相上下
接着测试 oMLX with Qwen3.8-35B-A3B-Distill-oQ8-fp16-mtp(38.6G)
(oMLX上没找到35B-A3B 4Bit的mtp模型)

A3B模型性能更好了,缺点是因为Q8占内存更高,上下文128K以上就压力太大了。
智力测试与27B(Q4)对比:

除了LIVECODEBENCH 低了不少,其余测试似乎和4Bit 27B不相上下
备注:
本人是纯菜鸟。不是UP主,不是从业者
自己在虚心关注,学习,练习中。
希望能拽住时代大浪潮的尾巴,不被甩开太远。
望各大佬不令指导指正。
用oMLX加载MTPLX优化的模型,关闭思考,启用Lightning MTP
Model用的是Qwen3.8-27B-MTPLX-Optimized-Speed (19.5G)
执行简单回话,任务,写个贪吃蛇小游戏

一次成功,图形画面也不错

数据还挺漂亮。
性能测试结果:

智力测试结果:
智能基准对比
模式 抽样 Qwen3.8-27B-MTPLX-Optimized-Speed
MMLU 抽样 1000/14042 83.6%
CMMLU 抽样 300/11582 80.7%
HELLASWAG 抽样 200/10042 93.0%
TRUTHFULQA 全量 817 84.8%
ARC_CHALLENGE 抽样 300/1172 96.7%
WINOGRANDE 抽样 300/1267 79.0%
GSM8K 抽样 100/1319 91.0%
HUMANEVAL 全量 164 91.5%
MBPP 抽样 200/500 80.0%
LIVECODEBENCH 抽样 100/1055 60.0%
BBQ 抽样 300/10864 92.7%
SAFETYBENCH 抽样 300/11435 86.3%
--- 详情 ---
MMLU 83.6% 836 1000 856 否
CMMLU 80.7% 242 300 93.5 否
HELLASWAG 93.0% 186 200 82.9 否
TRUTHFULQA 84.8% 693 817 245.3 否
ARC_CHALLENGE 96.7% 290 300 106.8 否
WINOGRANDE 79.0% 237 300 79.7 否
GSM8K 91.0% 91 100 515 否
HUMANEVAL 91.5% 150 164 375.9 否
MBPP 80.0% 160 200 535.2 否
LIVECODEBENCH 60.0% 60 100 2561 否
BBQ 92.7% 278 300 86.2 否
SAFETYBENCH 86.3% 259 300 91 否
可能是关闭思考的关系,LiveCodeBench测试只拿到了60%
别的基本都还挺高
另外补充我很喜欢的一点:
GPU 满载时 GPU功耗也就100W
仔细听可以听到风扇声音,但也非常轻。环境音下,不特别关注几乎完全注意不到。
这样就可以很放心的放在家里任何地方,无论是工作室,机房,甚至是卧室。

第一手测试资料:
先说基准测试 - MLX:
Qwen3.8-27B-MLX-6bit (模型 22.8G)
目前四档实测
Context Prefill Decode Peak Memory 512 tokens总时间
8K 921.3 tok/s 23.17 tok/s 25.26 GB 30.9 s
32K 845.4 tok/s 21.62 tok/s 26.87 GB 62.5 s
128K 596.8 tok/s 16.69 tok/s 33.69 GB 248.8 s
256K 436.7 tok/s 13.05 tok/s 42.74 GB 643.7 s
Qwen3.8-27B-MLX-4bit (模型 16.1G)
Context Prefill Decode Peak Memory 512 tokens总时间
8K 985.1 tok/s 31.92 tok/s 18.53 GB 24.3 s
128K 626.1 tok/s 21.10 tok/s 26.96 GB 231.6 s
256K 447.2 tok/s 15.49 tok/s 36.01 GB 613.8 s
基准和网上MacBook M5 Max的测试数据差不多;长上下文内存占用不多,256K 6Bit差不多42G,4Bit36G,还是跑的动,且有冗余20来G分配给系统和Agent等。长上下文是主要耗时还是在Prefill,将近10分钟。
我选Mac Studio M5 Max的理由:
等M5 Max Studio的原因:


被扣了声望,原贴想要修改编辑也不能了。
补上一些吧:
刚看到的Mac MinMaxH3 优化后MacBook 高配生视频介绍。
Mac Studio上线后有两个屌丝位:
M5Max 40GPU 614G带宽 64G内存 $3799 (1T硬盘)
M5Ultra 64GPU 1.2T带宽 96G内存 $5499 (1T硬盘)
目标如果是架设本地AI Qwen3.8-27B(35B)
偶尔有少许文生图,或少量视频生成需求,是不是会成为这个巨大的硬件甜点位?
只是分享一个刚看到的信息而已,本人不是原作者,也不是什么推广。
一直比较关注Mac生态罢了;受不了PC。
分享给大家品品靠不靠谱而已;毕竟新的Mac Studio上来了一大波硬件
视频搬运工:
Youtube Video