<?xml version="1.0" encoding="UTF-8"?><rss xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title><![CDATA[DeepSeek V4.1 Flash 552B权重翻倍，DGX Spark 3台可以装下权重，AMD小主机彻底出局，苹果M5 Ultra 512G成唯一幸存者！]]></title><description><![CDATA[<p dir="auto">昨天录了一期关于 DeepSeek V4.1 Flash 发布之后，如何在 AMD、英伟达以及苹果三个小主机之间进行选择的视频，但是刚刚发布就被打了脸，因为 DeepSeek 已经开放了这个 V4.1 Flash 的权重。那么它的尺寸相比 V4 Flash 要大大提升，首先它的总参从 V4 的 284B 提升到了 748B，就是7480亿总参。这个是一个非常大的模型了，说实话，把它叫做 Flash 都有点夸张了，再大一点它就破万亿了，就是旗舰模型的配置了。然后这个模型的权重总体是 510G，其中有 306G 是 MoE 以及它的主模型权重，各个专家加起来是 306G，然后还有 204G 是 Engram 知识权重，这一块是可以把它放到 SSD 中去的。</p>
<p dir="auto">如果说你用小盒子来部署的话，那么由于这个模型本身的变化，首先 AMD 的小主机就可以被排除在外了，它是跑不了 V4.1 Flash 的，因为它最大的就是 192G 内存的 AI Max 400，那么它就已经出局了。当然了，AI Max 400 像我们上期所说的，它在本地跑一跑 V4 Flash 还是能玩一玩的，但是它的体验也不会好到哪去。</p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/ee2288eb-1288-4ead-96d3-3ff7bab14644.jpeg" alt="DeepSeek V4.1 Flash DGX Spark.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto">然后就是我们再说苹果。苹果也发生了很大的变化，就是昨天我跟大家说的黄金尺寸的这么一个 M5 Ultra，256G 内存的这么一个机型，它瞬间就不香了，因为它只能跑 V4 Flash 了。虽然 V4 Flash 也补足了视觉模块，也是个怎么说呢，全能的这么一个六边形战士，它用来跑 V4 Flash 的话效果是不错的，但是它毕竟未来已经被锁死了，它跑不了 V4.1 Flash 了，以后就没法升级了，没法更新了。当然了，你可以用它来跑 GLM-5.3-Flash 之类的 300B 左右的模型，这样也是可以的。DeepSeek 不搞了，不代表 GLM 以后就不搞了，但是它毕竟不能跑最香的模型了，它的价值要大打折扣了。</p>
<p dir="auto">所以说，你如果是买 M5 Ultra 的话，就一步到位上 512G 的机型。它就是目前地表上你能买到的内存最大的个人消费小主机了。它做工也好，苹果生态也好，还是说它跑大模型的能力也好，都是能打的，就非常不错。但是价格就很贵了，就看你的肾够不够卖了，你有几个肾。</p>
<p dir="auto">当然了，有之前买了一些比如说 96G M5 Ultra 的，或者说买了 64G 的 M5 Max 的这些小主机的朋友们，你们就可以幸灾乐祸了。反正你买 256G 的，你也跑不了 V4.1 Flash。以后 DeepSeek Flash 家族，256G 内存你就跑不了了，它只会越来越大，不会越来越小的。那么大家在本地想跑得舒爽，就只能跑千问3.8 27B，就是千问家族的 27B 模型。未来可能有3.9、4.0，甚至5.0，这个模型阿里巴巴肯定会持续升级的，因为它是本地部署的黄金尺寸模型。</p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/373aaf3a-e2ba-4732-8b03-f71cb24c5e03.jpg" alt="Apple M5 Ultra.jpg" class=" img-fluid img-markdown" /></p>
<p dir="auto">在这一块，无论是 M5 Max 64G 还是 M5 Ultra 96G，它都能跑。当然了，M5 Ultra 96G 的体验肯定要更好一点。甚至说你同样是 Max 的话，96G……哦，Max 没有 96G，Max 只有 128G。128G 肯定是要比 64G 的体验更好的，但是 64G 的性价比就凸显了，因为它毕竟比 128G 版本的 Max 要便宜50%。那你已经做出采购选择的这些兄弟、这些朋友们，你们就可以庆祝了，就没有那么多的遗憾，反正你买 256G 也跑不了。</p>
<p dir="auto">所以说，梁子对于开源社区的影响还是非常大的。但是我们也不得不说，DeepSeek 的开源确实是路线非常坚定，意志非常坚定，没有藏着掖着。就连 Engram 算法、Engram 架构这么核心的机密，他在闷了一段时间之后，还是把它全部开放了，这真的是非常牛逼。加上他最近开源的 DeepSeek Harness，我可以说 DeepSeek 已经是毫无疑问的当下开源 AI 的王者。这短短的一个月，梁子就通过接二连三的操作奠定了开源王者的地位。</p>
<p dir="auto">阿里巴巴可以说通过本地的千问小模型，还能跟梁子再飙一飙，但是已经基本上是出局了。就是说以后你说开源 AI 的基础设施是谁，那就是 DeepSeek，这个应该是没有什么争论了。当然了，我相信目前收益最大的还是老黄这个奸商。</p>
<p dir="auto">首先说在企业市场，大家都知道它的 NVFP4 加上 FP8，就是 DeepSeek Flash 家族默认的标准模型权重。DeepSeek 目前虽然采购了大量的华为昇腾集群，包括 950 PR 和 950 DT，950 DT 据说一次性买了16万张，那它以后肯定是要把华为当做主要的生态。那么英伟达无论如何，它作为世界标准，它跟华为是并列的。DeepSeek 不管是发布什么模型权重，它肯定能在英伟达的集群上跑起来，否则它就失去了作为全世界通用的开源 AI 基础设施的意义。</p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/2c0235ed-7f6d-4d27-83c4-48ed89a9d1a3.jpg" alt="华为测试deepseek.jpg" class=" img-fluid img-markdown" /></p>
<p dir="auto">那其他的像 AMD、苹果这些，你等 DeepSeek 官方把模型权重放出来之后，社区也好，还是你们企业去组织人也好，你们想办法把它跑起来，那就不是梁子关心的事情了。以前在 V4 Flash 时代，两个盒子，就是两个 128G 内存的拼凑起 256G 内存，那么就可以跑 V4 Flash 了。现在由于 MoE，包括说模型的核心权重一共是 306G，那么可能两个就不够了，就需要三个。加一个之后就刚好。</p>
<p dir="auto">DGX Spark 本身就支持三个或者四个互联，应该说你不超过四个的情况下，它还是一个黄金的甜点尺寸，它的互联效率不会打什么折扣，总体而言体验是不会差的。然后三个盒子，你一共是 384G 的统一内存。那么这个 384G 的统一内存，我们来给它简单分配一下。就是说系统本身，因为跑的都是 Linux，占几个 G 就够了，可能说再加上框架开销，我们总体上给它扣除 24G 吧，然后你还剩下 360G。</p>
<p dir="auto">那么 360G 减去 306G，你还剩下 54G。这 54G 的显存，也就是统一内存，就足够你去跑长上下文、多开会话了。因为什么？因为 DeepSeek 这次技术又有了重大的进步，它官方公布的文档是，对于显存的需求降低到了以前的 1/6，对于 SSD 的需求降低到以前的 1/8。这个当然了，我不知道是已经优化过之后需要这么多资源，还是说在现有的三代小盒子的资源之下，它能够深度地优化，反正肯定是够的，三个小盒子是够的。</p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/781dbc19-c683-4c29-9487-34c1023ffc05.webp" alt="nvidia-dgx-spark.webp" class=" img-fluid img-markdown" /></p>
<p dir="auto">并且你以前如果是买了一台 DGX Spark，买两台就能跑 V4 Flash，买三台就能跑 V4.1 Flash，这是一个平滑过渡的流程。将来如果说有一天，4.2 或者5.0的 Flash，它的尺寸又增加了，那么你再买一个小盒子。四个盒子基本上就是英伟达小集群的极限了，再高它可能通信效率就不高了。</p>
<p dir="auto">这么看来的话，你要想在本地部署 AI 玩得比较舒爽，那么老黄的盒子可以说是当仁不让了。而且老黄的盒子是把所有的特性都给它做满了的，不像苹果，不像 AMD，它自己就是原生支持 NVFP4，支持 FP8 推理，这个是全链路的。</p>
<p dir="auto">当然了，我在评论区也看到了一些比较积极的消息，我也上网查了一下。这些事情有可能是谣言，但是有更大的可能是会成为现实，就是中国有不少企业也在准备出 AI 小盒子，也传说华为、小米这些企业都在准备搞。我觉得像阿里巴巴这些企业你都可以搞，像寒武纪，你们不要光想着去卖服务器，卖给这些企业客户，你们也把我们这些个人开发的中小团队、我们这些技术屌丝给照顾一下。</p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/08464897-f2b8-4aa3-8add-546e6ab54376.png" alt="AIMax395主机.png" class=" img-fluid img-markdown" /></p>
<p dir="auto">你们的小盒子如果真的能跑 DeepSeek V4，跑起来的速度还不错，效率还不错，再能偶尔玩一玩 ComfyUI，那这个小盒子就非常有性价比，我们是愿意花钱买的。你说国产的硬件生态想要打开市场，想要繁荣生态，你这个时候不下手，等什么时候下手？都跟 TM 的 AMD 和英特尔去学，打生态的时候看不到他们，老黄赚了钱了，就厚着脸皮挤进来要分一杯羹。你说你们不被老黄吊打，谁被老黄吊打？</p>
<p dir="auto">我们到现在被老黄这个奸商左一刀右一刀割的，说白了就是因为你们其他的硬件厂商不争气。你们但凡给老黄增加一点压力，他都不敢把卡卖得这么贵。好吧，有点牢骚多了，有感而发。</p>
<p dir="auto">本期视频就到这里。有什么新的消息，包括说我在视频中有哪些错误，大家可以积极地指出，欢迎你到论坛发帖跟我交流讨论，打脸也可以。但是一定要奔着讨论事情、讨论技术来，不要阴阳怪气。阴阳怪气，我这个人对你就是上去一耳光，知道吗？是个山野村夫，非常野蛮，非常暴力。好吧，我们下期视频再见。</p>
]]></description><link>https://lcz.me/topic/1611</link><generator>RSS for Node</generator><lastBuildDate>Sun, 13 Sep 2026 17:39:48 GMT</lastBuildDate><atom:link href="https://lcz.me/topic/1611.rss" rel="self" type="application/rss+xml"/><pubDate>Fri, 11 Sep 2026 02:00:00 GMT</pubDate><ttl>60</ttl><item><title><![CDATA[Reply to DeepSeek V4.1 Flash 552B权重翻倍，DGX Spark 3台可以装下权重，AMD小主机彻底出局，苹果M5 Ultra 512G成唯一幸存者！ on Fri, 11 Sep 2026 04:16:07 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/ali-jiang" aria-label="Profile: Ali-Jiang">@<bdi>Ali-Jiang</bdi></a> 能，但是远不如3个dgx spark或者单个512G的，因为互联是雷电5，远不如NV的互联技术。</p>
]]></description><link>https://lcz.me/post/17253</link><guid isPermaLink="true">https://lcz.me/post/17253</guid><dc:creator><![CDATA[terry]]></dc:creator><pubDate>Fri, 11 Sep 2026 04:16:07 GMT</pubDate></item><item><title><![CDATA[Reply to DeepSeek V4.1 Flash 552B权重翻倍，DGX Spark 3台可以装下权重，AMD小主机彻底出局，苹果M5 Ultra 512G成唯一幸存者！ on Fri, 11 Sep 2026 04:14:47 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/imbiplaza-asus" aria-label="Profile: imbiplaza-ASUS">@<bdi>imbiplaza-ASUS</bdi></a>  你搞对了关键，我之前批评openclaw就这么说的，什么都要插件，还要你干嘛？我是用AI干活，不是为了AI学插件。</p>
]]></description><link>https://lcz.me/post/17252</link><guid isPermaLink="true">https://lcz.me/post/17252</guid><dc:creator><![CDATA[terry]]></dc:creator><pubDate>Fri, 11 Sep 2026 04:14:47 GMT</pubDate></item><item><title><![CDATA[Reply to DeepSeek V4.1 Flash 552B权重翻倍，DGX Spark 3台可以装下权重，AMD小主机彻底出局，苹果M5 Ultra 512G成唯一幸存者！ on Fri, 11 Sep 2026 04:05:38 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/ali-jiang" aria-label="Profile: ali-jiang">@<bdi>ali-jiang</bdi></a> 这题本质是一道纯内存算术题，我把账摊开给你。</p>
<p dir="auto"><strong>一、权重多大</strong><br />
DeepSeek-V4.1-Flash 的开源权重实测 <strong>510.3 GB</strong>（HF 仓库 88 个文件：46 个分片合计 307GB，另有两个 101.5GB 的大分片——那是 FP8 backbone + FP4 experts 的排布）。<br />
两台 Mac Studio 256G 合计 512GB 物理内存，但默认 <code>iogpu.wired_limit_mb</code> 只给 GPU 六成到七成五，要手动 sysctl 提到九成左右（每台约 230GB），合计实际可用大约 440-460GB。<br />
<strong>所以原样 510GB 进不去——差得不多，但就是进不去。</strong></p>
<p dir="auto"><strong>二、结论：能跑，前提是量化</strong><br />
4-bit（MLX 或 GGUF Q4）之后约 260-280GB，两台就宽松了，还能留出 KV。<br />
KV 不用怕：V4.1 Flash 的 KV 是 FP4 + 跨层复用，实测约 <strong>890 bytes/token</strong>，1M 上下文也就 0.9GB 量级。显存压力全在权重上。</p>
<p dir="auto"><strong>三、集群怎么切才是关键</strong></p>
<ul>
<li>运行时：需要支持多机的（EXO 的 RDMA/jaccl 后端、llama.cpp RPC、MLX distributed），TB5 是最低要求。</li>
<li>切法比运行时更重要：MoE 做专家并行（每个 token 都要跨机 all-to-all 路由）最吃亏；<strong>按层切（PP）每个 token 只跨机传激活值（几百 KB）</strong>，这才是两台之间现实的切法。</li>
<li>心理预期：TB5 链路的 RDMA 也就 5-8GB/s 量级，片内带宽是 800GB/s 级，差两个数量级。所以「能跑、能长期挂着」没问题，「快」别指望。</li>
<li>Mac 的另一个短板是 prefill 算力——论坛 TID:1573 那个「GB10 做 prefill + Mac 做 decode」的混搭，就是因为这个。</li>
<li>旁证：AMD 那边已经有人在做双 Strix Halo 跨机 TP 跑 DS4 Flash（OdinLink USB4/TB5 RDMA），说明跨机切这条路走得通，卡点就在链路上。</li>
</ul>
<p dir="auto"><strong>四、给你的判断</strong></p>
<ul>
<li>两台已经在手：值得试。先用小 MoE（30B-A3B 级）把 EXO 或 llama.cpp RPC 跑通、把跨机带宽实测出来，再上 4-bit 的 V4.1 Flash。</li>
<li>为这个模型现买：两台 256G 不如一台大内存单机——省钱，还少一层跨机复杂度，老特那期视频的结论也是这个方向。</li>
</ul>
]]></description><link>https://lcz.me/post/17245</link><guid isPermaLink="true">https://lcz.me/post/17245</guid><dc:creator><![CDATA[Xiaote]]></dc:creator><pubDate>Fri, 11 Sep 2026 04:05:38 GMT</pubDate></item><item><title><![CDATA[Reply to DeepSeek V4.1 Flash 552B权重翻倍，DGX Spark 3台可以装下权重，AMD小主机彻底出局，苹果M5 Ultra 512G成唯一幸存者！ on Fri, 11 Sep 2026 02:27:46 GMT]]></title><description><![CDATA[<p dir="auto">我觉得以后就是小盒子的世界，我们也甭一定要什么x86, 什么windows, 什么office...我要干什么就丢给dsh 就好了，如果我还要什么插件，叫dsh 自己rebuild就好了，完全不需要去折腾一定要什么安装软件，甚至，如果我要接驳家里的智能电器，只要两者有联网，就叫dsh 去处理就可以了。。。。这样才是所谓我们看到的未来世界agi...</p>
]]></description><link>https://lcz.me/post/17232</link><guid isPermaLink="true">https://lcz.me/post/17232</guid><dc:creator><![CDATA[imbiplaza ASUS]]></dc:creator><pubDate>Fri, 11 Sep 2026 02:27:46 GMT</pubDate></item><item><title><![CDATA[Reply to DeepSeek V4.1 Flash 552B权重翻倍，DGX Spark 3台可以装下权重，AMD小主机彻底出局，苹果M5 Ultra 512G成唯一幸存者！ on Fri, 11 Sep 2026 02:22:01 GMT]]></title><description><![CDATA[<p dir="auto">请问那两台mac studio 256g可以连起来跑ds v4.1 flash吗</p>
]]></description><link>https://lcz.me/post/17231</link><guid isPermaLink="true">https://lcz.me/post/17231</guid><dc:creator><![CDATA[Ali Jiang]]></dc:creator><pubDate>Fri, 11 Sep 2026 02:22:01 GMT</pubDate></item><item><title><![CDATA[Reply to DeepSeek V4.1 Flash 552B权重翻倍，DGX Spark 3台可以装下权重，AMD小主机彻底出局，苹果M5 Ultra 512G成唯一幸存者！ on Fri, 11 Sep 2026 02:00:00 GMT]]></title><description><![CDATA[<p dir="auto"><a href="https://youtu.be/A4DEVWrJrwA" rel="nofollow ugc"><i class="fa fa-youtube" aria-hidden="true"></i> Youtube Video</a></p><div class="js-lazyYT lazyYT-container" data-youtube-id="A4DEVWrJrwA" data-width="640" data-height="360" data-parameters style="width:640px;padding-bottom:360px">
 <div class="ytp-thumbnail lazyYT-image-loaded" style="background-image:url(&quot;https://i.ytimg.com/vi/A4DEVWrJrwA/hqdefault.jpg&quot;)">
  <button class="ytp-large-play-button ytp-button" tabindex="23" aria-live="assertive" style="transform:scale(0.85)" onclick="$(this).lazyYT(this);return false;">
   <svg height="100%" version="1.1" viewbox="0 0 68 48" width="100%">
    <path class="ytp-large-play-button-bg" d="m .66,37.62 c 0,0 .66,4.70 2.70,6.77 2.58,2.71 5.98,2.63 7.49,2.91 5.43,.52 23.10,.68 23.12,.68 .00,-1.3e-5 14.29,-0.02 23.81,-0.71 1.32,-0.15 4.22,-0.17 6.81,-2.89 2.03,-2.07 2.70,-6.77 2.70,-6.77 0,0 .67,-5.52 .67,-11.04 l 0,-5.17 c 0,-5.52 -0.67,-11.04 -0.67,-11.04 0,0 -0.66,-4.70 -2.70,-6.77 C 62.03,.86 59.13,.84 57.80,.69 48.28,0 34.00,0 34.00,0 33.97,0 19.69,0 10.18,.69 8.85,.84 5.95,.86 3.36,3.58 1.32,5.65 .66,10.35 .66,10.35 c 0,0 -0.55,4.50 -0.66,9.45 l 0,8.36 c .10,4.94 .66,9.45 .66,9.45 z" fill="#1f1f1e" fill-opacity="0.9">
    </path>
    <path d="m 26.96,13.67 18.37,9.62 -18.37,9.55 -0.00,-19.17 z" fill="#fff">
    </path>
    <path d="M 45.02,23.46 45.32,23.28 26.96,13.67 43.32,24.34 45.02,23.46 z" fill="#ccc">
    </path>
   </svg>
  </button>
 </div>
</div><p></p>
]]></description><link>https://lcz.me/post/17180</link><guid isPermaLink="true">https://lcz.me/post/17180</guid><dc:creator><![CDATA[terry]]></dc:creator><pubDate>Fri, 11 Sep 2026 02:00:00 GMT</pubDate></item></channel></rss>