M5 Ultra 256G媒体机实测数据整理抢先看
-
M5 Ultra 256 G Mac Studio 上手实测:27B 本地模型 + 全套跑分(附 M3 Ultra 对比)
汇总自一段 M5 Ultra 256G上手体验视频的实测视频。所有数字均为视频中展示的原始数据,未做二次加工。
对比机型统一为 M3 Ultra。
一、测试环境与口径
本地大模型测试配置
项目 设置 模型 Qwen3.8-27B-4bit(15.7 GB) Benchmark Context Code (Python) 单请求测试项 pp1024 / pp4096 / pp8192 生成长度 128 tokens(固定) ANE-aligned prompts
开启(+1 token,使 prefill 对齐 2048 整块)连续批处理测试 2x / 4x / 8x(口径 pp1024 / tg128) Force mix-lm engine
开启 → 结果为 LM-only 基线(MTP 关闭)外部 API 端点 未启用(纯本地推理)
️ 由于 MTP 被关闭,以下推理数字属于保守基线,不是该机日常可用速度。
另外因开启了 ANE 对齐,测试项 pp1024/pp4096 在结果表中显示为 pp1025 / pp4097。
二、AI 本地推理
2.1 单请求原始结果
Test TTFT TPOT pp TPS tg TPS E2E Latency Throughput Peak Mem pp1025/tg128 661.8 ms 20.84 ms/tok 1548.7 tok/s 48.4 tok/s 3.318 s 347.5 tok/s 15.85 GB pp4097/tg128 2573.6 ms 21.09 ms/tok 1591.9 tok/s 47.8 tok/s 5.265 s 802.5 tok/s 17.01 GB 2.2 解码速度(单路)
机型 解码速度 M5 Ultra 51 Token/s M3 Ultra 35 Token/s 2.3 多并发解码(聚合吞吐)
并发数 M5 Ultra M3 Ultra 画面标注 2 并发 102.4 70.0 +46.3% 4 并发 169.4 130.0 +30.3% 8 并发 248.9 257.4 −3.3%
️8 并发是本组中唯一一项 M5 Ultra 落后 M3 Ultra 的测试。
2.4 多并发预填充
并发数 M5 Ultra M3 Ultra 画面标注 2 并发 1243.3 345.5 3.6× 4 并发 1071.9 302.4 3.5× 8 并发 1016.1 282.6 3.6× 横轴为并发数;纵轴画面标注为「每秒生成 token」。
2.5 8 并发端到端延迟
口径 pp1024 / tg512 | 单位:秒,越低越好
机型 端到端延迟 M5 Ultra 12.176 s M3 Ultra 32.971 s 画面标注:快 2.8 倍
三、CPU
3.1 Geekbench 7 CPU
项目 M5 Ultra M3 Ultra 提升 单核 3,711 2,963 +25.2% 多核 51,760 40,271 +28.5% 3.2 Cinebench 2026 CPU · 单核
机型 分数 锐龙 9950X3D 780 M5 Ultra 744 M3 Ultra 676 3.3 Cinebench 2026 CPU · 多核
机型 分数 提升 M5 Ultra 17,348 — M3 Ultra 12,082 +43.6%
四、GPU 合成基准
4.1 Geekbench 7 GPU
机型 分数 提升 M5 Ultra 352,444 — M3 Ultra 263,242 +33.9% 4.2 Cinebench 2026 GPU
机型 分数 RTX 5090 160,000 M5 Ultra 140,734 RTX 5080 100,000 M3 Ultra 83,865 M5 Ultra 对 M3 Ultra:+67.8%
4.3 Blender GPU 测试
版本 5.2.1 LTS | 单位:采样/分钟,越高越好
场景 M5 Ultra M3 Ultra 提升 杂货店 3,795 2,048 +85.3% 狮子 4,806 2,861 +68% 4.4 3DMark Steel Nomad
机型 分数 RTX 5080 8,800 M5 Ultra 8,052 M3 Ultra 5,548 RTX 5070 5,326 M5 Ultra 对 M3 Ultra:+45.1%
4.5 3DMark Solar Bay Extreme
机型 分数 RTX 5070 Ti 27,915 M5 Ultra 26,105 M3 Ultra 16,426 RTX 5060 Ti 15,300 M5 Ultra 对 M3 Ultra:+58.9%
五、光追与游戏实机
赛博朋克 2077 基准测试
口径:4K 分辨率 · 超级光追预设 · MetalFX 质量档 | 单位:每秒帧数,越高越好
项目 M5 Ultra M3 Ultra 提升 开启光追 37.28 20.39 +82.8% 关闭光追 60.32 47.78 +26.2%
六、提升幅度一览(M5 Ultra 对 M3 Ultra)
测试项 提升 Blender · 杂货店 +85.3% 赛博朋克 2077 · 开光追 +82.8% Blender · 狮子 +68% Cinebench 2026 GPU +67.8% 3DMark Solar Bay Extreme +58.9% 多并发解码 · 2 并发 +46.3% 3DMark Steel Nomad +45.1% Cinebench 2026 CPU · 多核 +43.6% Geekbench 7 GPU +33.9% 多并发解码 · 4 并发 +30.3% Geekbench 7 CPU · 多核 +28.5% 赛博朋克 2077 · 关光追 +26.2% Geekbench 7 CPU · 单核 +25.2% 多并发解码 · 8 并发 −3.3% 8 并发端到端延迟 快 2.8 倍 多并发预填充 3.5–3.6×
数据说明
- 本文所有数值均直接取自于视频内容,未做换算或修正,仅供参考。
-
补几个读数口径,方便和 x86 / N 卡横向比:
-
15.7 GB 权重、48.4 t/s 反推 decode 有效带宽约 760 GB/s(51 t/s 档约 800 GB/s),基本贴着这代统一内存的实际可达上限——单路 speed 已到顶,再往上主要靠 MTP / 连续批处理。
-
表里 M5 51 t/s vs M3 35 t/s 不要只记绝对数,要连引擎设置一起看(是否同为 MTP 关、同为 mix-lm 基线),否则会把架构差异和配置差异混在一起。
-
多并发建议同时给「聚合 t/s」和「单路 t/s」,不然 8x 的单路掉速会被聚合吞吐盖掉。
这组是关了 MTP 的保守基线,日常可用速度应该更高一些。
-
-
我昨天也追了一些,老實說,一個這麼大記憶容量,拿QWEN3.8 27B測試,你說用BF16就算了,還是用量化的,感覺好好的一個機器被糟蹋了,還是說跑Deepseek或是其他128B以上開源模型會難看到不行?醜媳婦總是要見公婆,沒看到直球對決,真的很可惜,再等等其他人的測試
-
我昨天也追了一些,老實說,一個這麼大記憶容量,拿QWEN3.8 27B測試,你說用BF16就算了,還是用量化的,感覺好好的一個機器被糟蹋了,還是說跑Deepseek或是其他128B以上開源模型會難看到不行?醜媳婦總是要見公婆,沒看到直球對決,真的很可惜,再等等其他人的測試
@David-Chen 23日后应该会有一批用户实测出来吧,这个视频发出来后还被博主自己删除过,过了几小时才重发的。
-
我昨天也追了一些,老實說,一個這麼大記憶容量,拿QWEN3.8 27B測試,你說用BF16就算了,還是用量化的,感覺好好的一個機器被糟蹋了,還是說跑Deepseek或是其他128B以上開源模型會難看到不行?醜媳婦總是要見公婆,沒看到直球對決,真的很可惜,再等等其他人的測試
-
你說用BF16就算了,還是用量化的,感覺好好的一個機器被糟蹋了
如果成绩好的话他会不用嘛,27b稠密bf16别说m5u了,连pro6000成绩都没法看。苹果选测试对象非常有讲究的。
小盒子2年内赌gb10阵营基本上问题不大。 -
M5 Ultra 256 G Mac Studio 上手实测:27B 本地模型 + 全套跑分(附 M3 Ultra 对比)
汇总自一段 M5 Ultra 256G上手体验视频的实测视频。所有数字均为视频中展示的原始数据,未做二次加工。
对比机型统一为 M3 Ultra。
一、测试环境与口径
本地大模型测试配置
项目 设置 模型 Qwen3.8-27B-4bit(15.7 GB) Benchmark Context Code (Python) 单请求测试项 pp1024 / pp4096 / pp8192 生成长度 128 tokens(固定) ANE-aligned prompts
开启(+1 token,使 prefill 对齐 2048 整块)连续批处理测试 2x / 4x / 8x(口径 pp1024 / tg128) Force mix-lm engine
开启 → 结果为 LM-only 基线(MTP 关闭)外部 API 端点 未启用(纯本地推理)
️ 由于 MTP 被关闭,以下推理数字属于保守基线,不是该机日常可用速度。
另外因开启了 ANE 对齐,测试项 pp1024/pp4096 在结果表中显示为 pp1025 / pp4097。
二、AI 本地推理
2.1 单请求原始结果
Test TTFT TPOT pp TPS tg TPS E2E Latency Throughput Peak Mem pp1025/tg128 661.8 ms 20.84 ms/tok 1548.7 tok/s 48.4 tok/s 3.318 s 347.5 tok/s 15.85 GB pp4097/tg128 2573.6 ms 21.09 ms/tok 1591.9 tok/s 47.8 tok/s 5.265 s 802.5 tok/s 17.01 GB 2.2 解码速度(单路)
机型 解码速度 M5 Ultra 51 Token/s M3 Ultra 35 Token/s 2.3 多并发解码(聚合吞吐)
并发数 M5 Ultra M3 Ultra 画面标注 2 并发 102.4 70.0 +46.3% 4 并发 169.4 130.0 +30.3% 8 并发 248.9 257.4 −3.3%
️8 并发是本组中唯一一项 M5 Ultra 落后 M3 Ultra 的测试。
2.4 多并发预填充
并发数 M5 Ultra M3 Ultra 画面标注 2 并发 1243.3 345.5 3.6× 4 并发 1071.9 302.4 3.5× 8 并发 1016.1 282.6 3.6× 横轴为并发数;纵轴画面标注为「每秒生成 token」。
2.5 8 并发端到端延迟
口径 pp1024 / tg512 | 单位:秒,越低越好
机型 端到端延迟 M5 Ultra 12.176 s M3 Ultra 32.971 s 画面标注:快 2.8 倍
三、CPU
3.1 Geekbench 7 CPU
项目 M5 Ultra M3 Ultra 提升 单核 3,711 2,963 +25.2% 多核 51,760 40,271 +28.5% 3.2 Cinebench 2026 CPU · 单核
机型 分数 锐龙 9950X3D 780 M5 Ultra 744 M3 Ultra 676 3.3 Cinebench 2026 CPU · 多核
机型 分数 提升 M5 Ultra 17,348 — M3 Ultra 12,082 +43.6%
四、GPU 合成基准
4.1 Geekbench 7 GPU
机型 分数 提升 M5 Ultra 352,444 — M3 Ultra 263,242 +33.9% 4.2 Cinebench 2026 GPU
机型 分数 RTX 5090 160,000 M5 Ultra 140,734 RTX 5080 100,000 M3 Ultra 83,865 M5 Ultra 对 M3 Ultra:+67.8%
4.3 Blender GPU 测试
版本 5.2.1 LTS | 单位:采样/分钟,越高越好
场景 M5 Ultra M3 Ultra 提升 杂货店 3,795 2,048 +85.3% 狮子 4,806 2,861 +68% 4.4 3DMark Steel Nomad
机型 分数 RTX 5080 8,800 M5 Ultra 8,052 M3 Ultra 5,548 RTX 5070 5,326 M5 Ultra 对 M3 Ultra:+45.1%
4.5 3DMark Solar Bay Extreme
机型 分数 RTX 5070 Ti 27,915 M5 Ultra 26,105 M3 Ultra 16,426 RTX 5060 Ti 15,300 M5 Ultra 对 M3 Ultra:+58.9%
五、光追与游戏实机
赛博朋克 2077 基准测试
口径:4K 分辨率 · 超级光追预设 · MetalFX 质量档 | 单位:每秒帧数,越高越好
项目 M5 Ultra M3 Ultra 提升 开启光追 37.28 20.39 +82.8% 关闭光追 60.32 47.78 +26.2%
六、提升幅度一览(M5 Ultra 对 M3 Ultra)
测试项 提升 Blender · 杂货店 +85.3% 赛博朋克 2077 · 开光追 +82.8% Blender · 狮子 +68% Cinebench 2026 GPU +67.8% 3DMark Solar Bay Extreme +58.9% 多并发解码 · 2 并发 +46.3% 3DMark Steel Nomad +45.1% Cinebench 2026 CPU · 多核 +43.6% Geekbench 7 GPU +33.9% 多并发解码 · 4 并发 +30.3% Geekbench 7 CPU · 多核 +28.5% 赛博朋克 2077 · 关光追 +26.2% Geekbench 7 CPU · 单核 +25.2% 多并发解码 · 8 并发 −3.3% 8 并发端到端延迟 快 2.8 倍 多并发预填充 3.5–3.6×
数据说明
- 本文所有数值均直接取自于视频内容,未做换算或修正,仅供参考。
-
我昨天也追了一些,老實說,一個這麼大記憶容量,拿QWEN3.8 27B測試,你說用BF16就算了,還是用量化的,感覺好好的一個機器被糟蹋了,還是說跑Deepseek或是其他128B以上開源模型會難看到不行?醜媳婦總是要見公婆,沒看到直球對決,真的很可惜,再等等其他人的測試