M5 Ultra 256G VS 双DGX Spark,谁是本地AI王者?96G的 M5 Ultra值得买吗?它和RTX Pro5000搭配高端PC怎么选?
-
并不是要针对大家这个正常的讨论。那么你们平时在论坛中,你看有人用这个什么4卡L40的,有用这个8卡的,是吧?还有买这个两张RTX Pro 6000的、M3 Ultra 512G的,都有。对啊,买这个多张RTX Pro 5000的、4090 48G的,双卡的是吧?这些比比皆是。是不是?就说我本人,我虽然也穷得跟屌一样,但是我还不是要买几万块钱的卡,是吧?我也得买这个什么4090D 48G,是不是?那一张卡也得小3万块钱。是吧,就说正常的讨论,不要有这种心理压力啊。我说那些话并不是为了针对各位。
然后呢,就说苹果这家公司,不得不说,它是非常有号召力的,它在生态影响力确实是独一档的。就是论坛平时其实讨论苹果的人其实是非常少的,但是呢,就是最近由于这个M5 Ultra它一发布,大家都觉得这个东西跑AI可能是一个利器,那么讨论的热度立刻就高上来了。而且有很多人确实是买了256G,买了这个96G的,他们已经下了订单,可能说不久之后就会到货。但是呢,大家可能说有些人还是在这个观望之中,还希望让我给出比较明确的意见。
其实最主要的就是几个。第一就是M5 Ultra 96G值不值得购买?它跟RTX Pro 5000之间究竟是谁的性价比高?第二就是M5 Ultra 256G,是吧,是不是就够了?需不需要上512G?第三就是M5 Ultra的256G跟两台DGX Spark,到底谁跑AI更好、更有性价比?那么本期视频啊,我们就为有钱人操一份心,为金主爸爸们操一份心。他们不少人是在我两个频道都有打赏,那么我也非常感谢他们对我的支持,我就不冷嘲热讽了。这期就是主打一个服务,主打一个体贴。

首先我们说一下,就是这个96G的M5 Ultra,它本身是非常有性价比的产品,它不是什么野路子,也不是什么上不了台面的东西。我们一般来讲,我们要上256G是干什么?就是跑DeepSeek V4 Flash,或者说跑GLM 5.3 Flash,这么300B左右的这个模型。它4比特量化之后,在这个256G统一内存上刚好可以跑得非常舒爽,上下文又够,又能够多开,然后体验就非常棒。
但是我们要知道,像这个什么DeepSeek V4 Flash,或者说像这个什么GLM 5.3 Flash,它们的在线版本确实要吊打我们千问3.8这个本地部署。当然这个差距也是可以接受的,但是这个体验差距还是比较明显的。不过如果说你是在本地部署,你部署不到DeepSeek或者说是GLM官方的那种水平。尤其是DeepSeek V4 Flash,你本地部署的体验不可能达到在线的程度。而且说实话,你相比于在本地部署的千问3.8 27B,并不会给你带来那种质的飞升。就这个体验的差距肯定是有的,但是不会有质的差距。
你这个96G M5 Ultra,根据之前M5 Max他们测试流出来的跑千问3.8 27B的这个真实的数据,你应该说跑过70 tokens这样子的吐字速度。单开的话,长上下文其实是没有什么问题的,而且1.2T的统一带宽,这种体验是相当棒的,你还可以多开。
苹果它最大的生态劣势就是ComfyUI。它如果说跑这个什么AI音视频、画图可能有劣势,其实最主要的就是AI视频了,比如说跑MiniMax H3、跑LTX2.3,它不行。除此之外,你要画图,它有这个DrawThings;要跑这个什么音频,像我这个M4 Mac mini,就最入门的丐版,它都能够跑这个什么VoxCPM。当然它速度比较慢,你是Ultra的话,就完全不用考虑在画图跟音频方面,它可能说体验有残疾,不会的,完全够用,是吧?那么你只需要放弃在本地跑这个视频模型。其实这个需求是,怎么讲,虽然是比较重要的需求,但是并不是所有的人都需要的。可能有30%的人有这样的需求,那么剩下70%的人,他们可能最多的需求就是在本地跑这个大模型,做到数据隐私,做到这个工作流不上云。

那么在这种情况下,96G的M5 Ultra是非常有性价比的。那是买这个入门的M5 Ultra 96G的,还是说去买这个RTX Pro 5000呢?RTX Pro 5000它之前是只有4万块钱不到,现在也涨到了5万块钱。你要再给它搭配一套高性能的PC,是吧,上到64G的内存,那么怎么着也得有6万块钱以上。
如果说你是一定要跑视频,比如说要跑MiniMax H3,那么还是要上RTX Pro 5000加x86 PC的这个组合。但是如果说你没有这个需求,你在任何情况下使用这个96G统一内存的M5 Ultra入门款,它的体验都会远远好于你组装一个x86 PC。因为苹果的那种极致的安静,是吧,那种给你带来的操作系统的稳定性,给你带来的那种愉悦,带来的那种信心,这个是x86系统永远都无法弥补的。这个差距是非常明显的。就无论你是上这个Linux还是上Windows,你在操作系统层面的体验就天然被macOS拉开了差距。
你96G的这个M5 Ultra,你本身开着一个千问3.8 27B,是吧,做这个推理,你可以开两三个会话都没有什么问题。因为这个96G的统一内存可以划2/3,比如说六七十个G给到你这个显卡来专用,那么你剩下来的这个几十个G,你仍然可以非常从容地来开几个什么Agent程序,比如说Hermes,比如说DeepSeek Harness、Codex,你可以同时都开着,甚至把Opencode也给开上。然后你同时开很多网页,你还可以同时开剪辑软件,轻度办公都没有问题。
就它的体验是非常棒的。甚至说如果不是现在穷的话,我都想买一个96G的M5 Ultra。因为我现在的这个本地跑AI的工作都已经交给了我的4090D 48G,还有7900 XTX,交给这台洋垃圾的服务器。所以说我更加倾向于买这个Mac mini M6,是吧,或者说去买这个M1、M2的Mac Studio这种二手机器,性价比不错的。我买来主要用来干什么?用来剪辑视频、办公,做我现在这个工作的备份,写写程序,是不是?不会用它们来跑AI。
那么下面就回到,上到256G的M5 Ultra够不够?需不需要上到512G?就是说实话,是完全不需要上到512G的。因为我们现在跑的这个DeepSeek V4 Flash跟这个什么GLM 5.3 Flash这种300B级别的模型,像DeepSeek为例,对不对?它官方的这个权重是NVFP4与FP8混合权重,那它总共才一百几十个G,140个G左右吧,它还剩下好几十个G的空间。是吧,就算你扣掉这个系统开销,还有大几十个G的空间给到这个什么KV缓存,你可以充分多开,完全没问题的。

而且由于这种MoE模型,它激活的这个参数只有十几B,13B、14B的样子,那么它实际上跑起来的时候,它推理的开销比千问27B还要低。就如果说你上到256G内存就完全够用了,没有必要去考虑上512G。
当然了,有一个比较经典的选择,就是你必须要面对的,就是到底是买这个M5 Ultra 256G,还是买两台DGX Spark。就是说实话,如果说你纯粹是为了跑AI,无论是跑音视频画图,还是跑这个什么DeepSeek V4 Flash这样的MoE大模型,那么两台DGX Spark的体验毫无疑问都是要好于M5 Ultra的。
因为社区现在已经有非常成熟的两台DGX Spark并联去跑DeepSeek V4 Flash了。它们可以多开长上下文,而且它们的吐字速度是非常不错的,是非常流畅的,有成熟的方案。论坛就有这样的方案,大家如果说想要知道怎么部署,去抄作业就行了。我们论坛的这个大神Botonyi刚刚就发布了两台DGX Spark初步实测的这个帖子,大家可以去抄作业嘛。也还有其他人发布类似的帖子,大家都可以去研究一下,交流讨论一下。
我未来可能会做一个专门的主题页面,来介绍这个苹果M5 Ultra,包括DGX Spark,包括AMD的AI Max 395、400,它们这些小主机具体的性能怎么样,然后论坛有哪些帖子在测试它们。我把这些东西都整理成专题的网页,以比较好的方式给大家展示出来,方便新人来参考。
就是两台DGX Spark来跑DeepSeek V4 Flash,它是有具体的参照的。那么M5能不能跑?理论上来讲的话,苹果虽然不支持NVFP4,不支持这个FP8,但是它可以把这个权重转为INT4加INT8的混合权重,然后推理的时候返回BF16推理。说到这里,如果说返回BF16推理的话,它的推理效率确实是不如两台DGX Spark的算力的。但是它有一个很大的优势,就是它有1.2T的统一带宽。DGX Spark它只有273G还是多少G,反正270G左右的单一带宽。你即便用这个高速的数据线把两台互联起来,它们的通信效率实际上也是不高的。所以说一个是带宽劣势,一个是算力劣势,二者基本上我打个持平吧。
但是我们要知道,这个英伟达的生态好,它有一个好处,它有一个巨大的优势,就是它的SGLang是完整版本的SGLang,它支持Radix缓存树。Radix缓存树是什么意思?就说你多会话可以共享公共的这个提示词。你新增会话,如果说你执行相类似的任务,或者说基本相同的任务,那么你每一次请求所需要计算的新的这个tokens是非常少的,它的prefill压力是不大的,就可以把带宽的劣势给很好地弥补出来。而且它能够上什么HiCache,上什么这些比较新的SGLang的技术,是吧,像什么MTP投机解码、DFlash,尤其是最近比较流行的DSpark,它们能够大大地降低对于带宽的依赖,就这个劣势会被大幅度地缩小。
总体上,如果说你跑MoE大模型,两台DGX Spark它的体验会更好。然后如果说跑ComfyUI,两者画图跟音频都是完全没有问题的。M5 Ultra我之前也讲了,它音频跟画图我都是实测过的,完全没有问题。就在我这个M4的Mac mini上都能够跑起来,虽然比较慢。你想一想,M5 Ultra要比我这个领先多少倍,所以完全也不会有问题。

但是视频是M5 Ultra的这个硬性的残疾,因为苹果家族的这个FP32的卷积原始算力是非常低的,然后它的生态又不好,所以说它这块的体验是比较差的。但是你说能不能跑?肯定也是能跑的,你如果能忍受它慢,是吧,是不错的。当然我们需要知道,DGX Spark它跑视频的时候它也慢,不过它毕竟是英伟达的这个最新的生态,它是Blackwell的生态。所以说总体上,你两台同时开着,是吧,两台并联跑两个任务,它也慢不到哪去。是吧,再慢你可以乘以2嘛,是不是?可以双开嘛。
所以说总体上,如果说你是纯粹为了跑AI,那么两台DGX Spark,它的价格现在如果是第三方的话,加起来大概是7万块钱,京东官方两台套餐加上数据线是8万2。那么它的性价比我认为是要好于这个8万块钱左右的M5 Ultra 256G。
但是我们要知道,很多人买这个设备,它不仅仅是为了跑这个大模型,是吧,不仅仅是为了跑ComfyUI,或者说有70%的人,他可能不需要ComfyUI。在这种情况下,你去买这个M5 Ultra 256G,是吧,为了苹果的生态,为了苹果的逼格,那我觉得也是无可厚非的。
就从使用寿命的角度来讲的话,虽然说我没有长期去测试使用DGX Spark,或者说苹果的这个M5 Mac Studio,是吧,但是一般来讲,这个苹果产品的寿命是远远要高于x86的。就像我2020年还是2021年买的这个M1 MacBook 16G,它到今天依然可以非常轻松地胜任我的简单4K视频剪辑任务。而同时我晚几年买的这个什么Windows的笔记本,3060的笔记本,虽然只有三年左右的时间,说实话用它来剪辑,当然了也可以剪了,但是这个体验就相当糟糕了。就发热也比较严重,然后有的时候也比较卡顿,就总之体验不是很好。

然后我们必须说一下,就DGX Spark,它跟RTX Spark虽然是同一个芯片,但是它不支持Windows。但是呢,如果说未来有一天这个RTX Spark正式发售了,它的生态能够跑这个ARM Windows,那么很快一定社区会把它平移到DGX Spark这个平台上,这个时间不会需要太长时间。但是即便如此,它的主要生态还是在这个Ubuntu操作系统上,它的ARM Windows的体验跟标准的Windows还是有差距的。标准的Windows都是远远不及苹果的macOS,就更不要提ARM Windows了。
就你买这一块,你需要接受这个现实,就是它生态上面,就是日常办公的生态可能说不太好。当然了,肯定你二者都是够用了,因为毕竟可以上Windows嘛,二者都是够用的。就整体的体验还是苹果会更好。
就是本期视频呢,就是我们这些卖白菜的,为那些高收入的卖白粉的操了一顿心,是吧,这也没有办法。咱也不能总是服务于底层的普罗大众,是吧,咱也得偶尔为高端的金主爸爸们服务一下,为他们在这个论坛的支持跟打赏,在频道的支持跟打赏,买下单,好吧,交付一下这个比较贴心的服务。如果说你有类似的兴趣,想要对相关的话题发表看法,欢迎到论坛发帖交流讨论。
-
请教各位大神。我因为Deepseek Harness和Qwen3.8-27B的出现开始学习部署本地模型。但手头只有一台PC: Intel(R) Core(TM) i9-14900KF+ NVIDIA GeForce RTX 4070 Ti SUPER 显存: 16 GB,内存: 31.7 GB,只能跑Qwen3_8-27B-UD-Q3_K_XL。64k的上下文也只能跑个十几tokens/s。想自己编写DSH插件都非常吃力。如果我直接买一台新的兼顾办公和本地AI的主机,是不是买M5 Ultra+256G更好?我办公的主要内容为:把数小时的录音转文字作总结,再加上处理图片来做PPT。另外还要审理编写PDF,WORD,EXCEL文件。编程。少量的视频创作。由于要处理敏感内容,只能动用本地AI。
-
请教各位大神。我因为Deepseek Harness和Qwen3.8-27B的出现开始学习部署本地模型。但手头只有一台PC: Intel(R) Core(TM) i9-14900KF+ NVIDIA GeForce RTX 4070 Ti SUPER 显存: 16 GB,内存: 31.7 GB,只能跑Qwen3_8-27B-UD-Q3_K_XL。64k的上下文也只能跑个十几tokens/s。想自己编写DSH插件都非常吃力。如果我直接买一台新的兼顾办公和本地AI的主机,是不是买M5 Ultra+256G更好?我办公的主要内容为:把数小时的录音转文字作总结,再加上处理图片来做PPT。另外还要审理编写PDF,WORD,EXCEL文件。编程。少量的视频创作。由于要处理敏感内容,只能动用本地AI。
-
@Canhui-Li 这个预算的话看你视频取向,爱折腾ai视频上pro5000 72G,爱自己拍自己剪就你选的M5u/256G挺好
@Canhui-Li 这个预算的话看你视频取向,爱折腾ai视频上pro5000 72G,爱自己拍自己剪就你选的M5u/256G挺好
谢谢你的意见。M5u/256G在AI视频生成方面很烂吗?我要求不高,720+十几秒就够,也不经常生成。对比起我现在用RTX 4070 Ti,M5u/256G在速度和视频的质量上是不能有大提升呢?
-
@Canhui-Li 这个预算的话看你视频取向,爱折腾ai视频上pro5000 72G,爱自己拍自己剪就你选的M5u/256G挺好
谢谢你的意见。M5u/256G在AI视频生成方面很烂吗?我要求不高,720+十几秒就够,也不经常生成。对比起我现在用RTX 4070 Ti,M5u/256G在速度和视频的质量上是不能有大提升呢?
@Canhui-Li 要生视频尽量只考虑cuda生态,不然是你就是天天折腾工具而不是在创作
-
请教各位大神。我因为Deepseek Harness和Qwen3.8-27B的出现开始学习部署本地模型。但手头只有一台PC: Intel(R) Core(TM) i9-14900KF+ NVIDIA GeForce RTX 4070 Ti SUPER 显存: 16 GB,内存: 31.7 GB,只能跑Qwen3_8-27B-UD-Q3_K_XL。64k的上下文也只能跑个十几tokens/s。想自己编写DSH插件都非常吃力。如果我直接买一台新的兼顾办公和本地AI的主机,是不是买M5 Ultra+256G更好?我办公的主要内容为:把数小时的录音转文字作总结,再加上处理图片来做PPT。另外还要审理编写PDF,WORD,EXCEL文件。编程。少量的视频创作。由于要处理敏感内容,只能动用本地AI。
你只是欠一张 32gb vram 显卡。。。
-
,J johnnybegood 引用了 此主题
-
家里放了 DGX Spark TP2,随身带 14 寸 Macbook Pro M5 Max 128G
本来我也一直在等 M5 Ultra Mac Studio但是看到出来的定价,还是 Spark 阵列的性价比明显更高了 -
@terry
我其实就是笔记本到处跑,家里 Deepseek V4 Flash 0731随时待命
Agent 主要的任务几乎都跑在Deepseek 上,一些快速对话和任务就笔记本自己解决
然后我还没切换到 Vision Exp,所以视觉多模态都是本地用 Qwen3.8 27B作为前端先处理再喂Deepseek
128G 的 RAM,可以跑 Qwen3.6 35B A3B和 Qwen3.8 27B同时加载并发并且系统和其他工作软件也不影响
Qwen3.8 Flash Next我下了 oQ4e量化,在等 oMLX 继续完善
我的主要需求是复杂的办公,并不是 coding,未来复杂任务的工作流可能是本地 Qwen3.8 Flash Next + Deepseek V4 Flash Vision Exp + 线上的 Qwen3.8 Max这样的聚合 -
@terry
我其实就是笔记本到处跑,家里 Deepseek V4 Flash 0731随时待命
Agent 主要的任务几乎都跑在Deepseek 上,一些快速对话和任务就笔记本自己解决
然后我还没切换到 Vision Exp,所以视觉多模态都是本地用 Qwen3.8 27B作为前端先处理再喂Deepseek
128G 的 RAM,可以跑 Qwen3.6 35B A3B和 Qwen3.8 27B同时加载并发并且系统和其他工作软件也不影响
Qwen3.8 Flash Next我下了 oQ4e量化,在等 oMLX 继续完善
我的主要需求是复杂的办公,并不是 coding,未来复杂任务的工作流可能是本地 Qwen3.8 Flash Next + Deepseek V4 Flash Vision Exp + 线上的 Qwen3.8 Max这样的聚合

,秀下你的使用经验,给论坛弄点有价值的资产。

