<?xml version="1.0" encoding="UTF-8"?><rss xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title><![CDATA[英伟达Rubin+Groq重磅发布：推理性能暴增30倍，成本降35倍，老黄却可能走了一步臭棋？]]></title><description><![CDATA[<p dir="auto">很久没把我的笔记本拿出来了，这次是被迫拿出来。因为什么呢？老黄在本周开了一个重要的发布会，这里面的新名词太多，我这个老年痴呆的大脑基本上已经被干冒烟了，GPU 已经冒烟了，CPU 也冒烟了，也马上要烧掉了。没办法，我只有把笔记本端出来，照着念一下。当然我没有写稿子，我只是把这个发布会上的东西让 GPT 给整理了一下，我就照着念一下。</p>
<p dir="auto">这个发布会是干什么呢？就是发布了新的 Rubin 架构 GPU，然后是新的 NVLink、机柜、新的 Groq 推理芯片，还有 Vera CPU，这一整套打包，并且还赠送了一个叫 Dynamo 的调度框架。这个框架干什么呢？它就负责 MoE 大模型的请求路由、KV Cache、Prefill、Decode、资源调度、扩容缩容等等。这件事情特别吊诡，老黄现在已经不仅仅想卖芯片了，卖芯片已经完全不能满足他了，他要卖一整套软硬件解决方案。</p>
<p dir="auto">这套方案有什么恐怖之处呢？就是它在特定的 Agent workload 下，最高可以做到 30 倍的吞吐，在同样 1MW 能耗的情况下，Token 成本降低 35 倍。这样一整套的系统级优化，虽然它不是裸 GPU 性能提升 30 倍，但是已经非常恐怖了。Rubin 架构的 GPU，在传统的 BF16、FP32 这样的标准算力下，性能应该是提升了两倍；如果以自家的 NVFP4 这个特定格式来计算的话，性能可能提高了 4 倍左右到 5 倍的样子。但是这个不足以让这场发布会变得如此震撼，以至于我都想来讲一下，最重要的还是它这个所谓的整体解决方案，30 倍的吞吐提升，对 Agent 场景进行大幅度优化。老黄已经从大模型时代跳脱到 Agent 时代，从卖硬件转为卖解决方案。</p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/ee89d0ab-2ef2-4cad-a54a-799c230859cc.jpeg" alt="英伟达rubin groq 黄仁勋" class=" img-fluid img-markdown" /></p>
<p dir="auto">这个事情怎么看呢？给大家举一个简单的例子。比如说现在 DeepSeek、Kimi，你们是什么呢？你们是刘一手，是海底捞。你们的后厨有一整套买菜、洗菜、切菜、上菜，还有前台收银、服务人员调度，包括店内用什么锅、用什么样子的装修风格，甚至海底捞还有一些额外的服务、才艺表演。这一整套解决方案其实门槛是比较高的。如果现在你是地主家的傻儿子，去海底捞吃了之后感觉味道挺不错，去刘一手吃了也觉得挺不错，那么你自己也想开个火锅店。但是你除了饭量比别人大、口袋里的钱比别人多，就没有什么优势了，可以说对开火锅店一窍不通。</p>
<p dir="auto">那怎么办呢？老黄说，不要紧，你把钱给我。我现在有一个加盟方案，我的加盟方案干什么呢？就是说刘一手有的我都有，这一整套后厨体系，包括前台管理体系，包括如何选址、装修的标准，我都有。你只需要把店员招聘好，把选址给选好，把加盟费给我，剩下来的你就不用操心了，这一整套我帮你部署好，到时候你自己经营就行了。别人叫刘一手，我们就叫张一手、王一手、孙一手；别人叫海底捞，我们就湖底捞、河底捞，怎么捞不是捞，反正捞起来都能吃。</p>
<p dir="auto">这件事情对于生态的影响有多大？有人说，这个方案出来之后，什么遥遥领先、华为完蛋了，国产这些 AI 芯片企业完蛋了，它们活不下去了，将来将成为笑话。我怎么讲？这一块影响的是推理市场，而且影响的是美国的推理市场。因为老黄的芯片、解决方案无论再怎么先进，它卖不到国内来，我们国内有钱也买不到。所以什么华为、海光这些国产 AI 算力解决方案，它们不用担心，它们再怎么说在国内这个市场是没有问题的。</p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/5d197a12-85f3-4160-9c2e-19a1f48942e0.jpg" alt="华为超算.jpg" class=" img-fluid img-markdown" /></p>
<p dir="auto">第二，这个东西影响的是推理市场，它对于训练市场是没有多大影响的。比如说遥遥领先现在不是要出什么 950DT 吗？它提供的是光互联的解决方案，就是它在机柜性能上面、在单芯片性能上面，毫无疑问被英伟达吊打。但是它这个光互联方案一旦上升到万卡集群，甚至 10 万卡集群，华为在光互联方面的技术确实要遥遥领先于英伟达。这一块用华为自己的话来讲，就是华为在未来几年都会保持全球 AI 算力第一的宝座。这不是吹牛逼，它也是在特定的场景下。既然你老黄喜欢用特定场景，那我华为也是在特定场景，就是我的机柜规模比你更大，我的集群规模远比你大，暴力出奇迹。那么我就用更多的 GPU、更高的能耗，堆出比你英伟达更厉害的集群。</p>
<p dir="auto">而且训练市场说实话，玩家就那么十几家，十家八家头部企业。也不是所有的企业玩 AI 都要去训练模型，它们更多的就是推理。所以训练这一块，我觉得老黄可能也认识到了，芯片性能再强，下游企业也不可能隔个两三年就迭代一次，因为没有必要。尤其是 MoE 架构出来之后，它参数再大，也不是所有参数一定要同时训练的。它只要把主干跟路由部分训练好，然后其他的专家可以分开训练。没有必要一定采用那么先进的 GPU，也没有必要一定把这个集群隔个两年就换掉，这个成本是非常高的。</p>
<p dir="auto">但是推理市场就不一样了。推理市场还是一个蓝海市场，是一个增量市场，这个市场的潜力还非常大，有非常多的玩家想要进入这个市场。但是由于门槛有点高，或者由于算力不够、供应不够，这些企业可能就进不来。举个简单的例子，比如 Together AI 这种第三方算力贩子，像 OpenRouter 这种 AI 聚合平台，像 Hugging Face，它们都想建立自己的算力中心，都想用 DeepSeek、千问这样的开源大模型来搭建自己的算力。但是你叫它们像 OpenAI 那样去花几十亿美金、上百亿美金，甚至跟英伟达签订几千亿美金的长期供货合同，你觉得它们有这个本钱吗？它们连想都不敢想，这个门槛太高了，它们搞不定。</p>
<p dir="auto">再比如说像 Uber，像我之前提到的一些金融企业、医药企业，它们也想建立自己的私有 AI 中心。但是它们肯定不想去训练大模型，它们只想下载一些开源大模型，自己做个蒸馏、微调，然后自己再搭建一套 Agent 系统。对于它们来讲，它们是愿意花钱的，花钱的欲望也很强，但是它们不会去搞训练。现在老黄很简单了：你也不要去买什么 AMD 的 CPU、英特尔的 CPU 了，也不要去搞什么开源框架了。你要折腾什么 SGLang、vLLM，还得下这个大模型、那个大模型，去考虑路由怎么处理、KV Cache 怎么处理、Prefill 和 Decode 怎么分配、资源怎么调度、怎么扩容缩容，这个太复杂了，你不用考虑了，你就把钱给我。</p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/2a3df8ee-f0d6-45a4-aa9b-3e3934311dec.jpeg" alt="老黄掀桌子.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto">剩下来的就是你把机房选好，我把我的机柜送过来，解决方案给你挑好。你自己想怎么微调就怎么微调，我把调试方案给你出一个 PDF，再出个文档，你让你自己的工程师来看就行了。有什么问题，打电话给我英伟达的工程师，其他的事情你就不用搞了。然后英伟达挣你什么钱呢？挣你硬件的钱，挣你解决方案的钱。当然最主要的还是挣硬件的钱，解决方案未来肯定非常挣钱，但是现在对于老黄来说，他最大的目标还是要打开硬件的市场需求，把自己的卡尽可能卖出去。</p>
<p dir="auto">但是我们要知道，这个东西说白了毕竟是山寨，就是英伟达做的是统一的解决方案，你不可能比大模型企业自家做得好。比如说你山寨一个 DeepSeek，你的效率能干得过 DeepSeek 自己吗？那不可能。DeepSeek 的效率之所以这么高，官方 API 为什么这么便宜，就是因为它做了比如 Engram，它的显存、内存、SSD 三层缓存方案，然后有什么 HCA、CSA 这样的注意力机制。从大模型到 Agent，人家都是自己开发的，所以这一整套系统下来，它的效率非常高，成本就能够压到很低。英伟达是做不到 DeepSeek 这个程度的，但是它可以做到 DeepSeek 官方比如 50%、60%，甚至 80% 的效率，这就非常够了。</p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/56f82167-348a-409c-88b8-07eb0f469fa7.jpg" alt="DeepSeek Engram架构.jpg" class=" img-fluid img-markdown" /></p>
<p dir="auto">因为对于美国企业来讲，如果请求 DeepSeek 官方 API，可能有法律风险，可能有政治风险，它可能就会考虑这个风险。如果说它自建，或者调用的是 Together AI、Hugging Face 或者 OpenRouter 这种美国平台，数据不出美国，那么这些企业可能就不担心了。老黄的目标也从来不是要把 DeepSeek、Kimi、GLM 这种开源大模型给干死。他就很简单，自己也自研大模型，但是我不能保证比这些开源大模型更先进。他自家的大模型叫什么？Nemotron。那个大模型做得真的是一言难尽，就是免费挂在 OpenRouter 上，然后调用量也只能说勉强看得过去。你想一想，完全免费白嫖，结果都是门可罗雀，你想这得有多丑。</p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/91e103d0-061e-4ae5-b677-878577c4b1ba.jpeg" alt="Hugginface 模型排名" class=" img-fluid img-markdown" /></p>
<p dir="auto">这件事情对于英伟达来说，确实是大赚特赚的事情，可是它对于美国的 AI 产业来说，我觉得是一剂毒药，而且是非常大的毒药。首先，美国 AI 的龙头企业支撑了这个产业的繁荣，比如 Anthropic、OpenAI、Grok、谷歌，包括 Meta 的 Muse，这些头部模型消耗了大量的英伟达 GPU，把这个市场的估值不断抬高。然后你像 OpenAI，它们不仅现在采购大量 GPU，未来还有相当长的年限要绑定，必须承诺采购英伟达的 GPU，而且这个数量是相当惊人的。</p>
<p dir="auto">它们研发这些大模型是要花很多钱的，而且这些企业都还没有赚钱，都还在亏损的情况下。Anthropic 可能说略微赚了点钱，但是那也是财报做下来的，总体上它肯定还是亏损的。就在这些头部大模型企业还没有赚钱的时候，你把大模型的门槛突然间打到了地板上。像这些算力贩子，它们可以用你 1/10，甚至 1% 的价格去提供 DeepSeek。比如 OpenAI、Anthropic，你们的模型是 100 分，那我的 DeepSeek 是 85 分、90 分，但是我的成本是你的 1/10。</p>
<p dir="auto">这件事情以前可以说，Kimi、GLM、DeepSeek 是中国模型，你的数据要去中国，不安全。美国公司可能有这样那样的疑问，Anthropic 和 OpenAI 可以大肆宣传说这样不安全，那有一部分企业可能会买单。但是如今你把这个门槛打到地板上之后，这个模型是开源的，然后开源社区证明它是安全的，并且它是可控的，你可以二次蒸馏、微调、改进，然后把它部署到美国的服务器上。还有你说这些 Anthropic 也好，OpenAI 也好，它们开发这个大模型想干什么？它们想卖给谁？难道都是卖给你我这样的屌丝吗？一个月 10 美金、20 美金这样的订阅费用，对于它们来说是不少，但是已经可以看到它的上限就那么多了，它的成长故事性并不强。</p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/c0778dd5-cec8-441b-a8fa-19dee6e310ac.jpg" alt="kimi minimax glm deepseek.jpg" class=" img-fluid img-markdown" /></p>
<p dir="auto">它们那么高的估值，万亿级别美元的市场估值来自于哪里？大部分是来自于企业。它们想去做 Uber，想去做熊猫送餐，想去做这些大型 IT 企业的供应商。但是你现在推出这么个玩意之后，如果你是 Uber 的 CEO，你会愿意倾向于自己采购，去装 DeepSeek，还是说去采购昂贵的 Anthropic 或者 OpenAI 的大模型呢？你玩了一招釜底抽薪。是的，你英伟达是安全了，你的芯片卖得多了，整个生态也繁荣了，你的皮夹克穿上去之后，每年都能讲新的故事，那这些曾经跟你一起打天下的老哥们怎么办？</p>
<p dir="auto">你要知道，它们曾经花了百亿美元、几百亿美元，甚至上千亿美元去购买你这个昂贵的 GPU。H100、H200 这样的老 GPU，现在还在它们的分摊账单上面。本来一张卡正常情况下应该算是 3 年折旧，但是由于你的卡太贵了，这些大企业不得不把你的卡分摊到 6 年，甚至 7 年、8 年。对于它们来说，H100、H200，包括 B200、B300，现在还在资产负债表上，还没下去呢。结果不到两年的时间，你一个 Rubin 架构出来之后，搭配 Groq，加上新的 NVLink、Vera CPU，还有 Dynamo 调度框架，我操，你是把自己电到高潮了，你的这些老哥们怎么办？那不是泪流满面吗？</p>
<p dir="auto">还有现在说白了，中美两国的 AI 战争、芯片战争，其实最终看的是什么？就是一个现象、一个结果、一个标准：谁的大模型能够笑到最后。而中国不需要做到比美国优秀，只需要做到保持你美国 100 分，我是 95 分就行。如果说有一天，美国这些头部 AI 大模型企业因为老黄这么瞎搞，失去了自己的利基市场，输掉了 AI 大模型头部竞争，世界头部的大模型变成了 DeepSeek，变成了 Kimi，变成了中国大模型，你们有没有想过这个后果呢？</p>
<p dir="auto">你美元霸权绑定的是科技霸权，包括你的军事霸权，其实一切的一切，根源还是你的科技霸权。如果说你的科技上面被中国超越了，那么全世界对美国的信心会出现崩塌。美国当世界老大，全世界这些中立国家，或者说美国的小弟们，是能够接受一种叙事的：中国是一个特别牛逼的国家，但是美国是 100 分，中国永远是追赶者，中国是 90 分。我永远跟着 100 分混，这个是没有错的选择。可是如果有一天他们发现，100 分是中国，你美国是 99 分，那这个影响是灾难性的。</p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/c88c3472-af39-4d0f-ae70-0f3164a54fe4.jpg" alt="中美AI战争.jpg" class=" img-fluid img-markdown" /></p>
<p dir="auto">你别忘了，在工业实力上面，你跟中国现在已经不在一个级别了，你跟中国已经没法竞争了，中国的工业实力是你的好几倍。如果说你再输掉科技战，你这美元靠什么来支撑？靠你那存量的 11 艘航母吗？你不觉得这是个笑话吗？</p>
<p dir="auto">那站在我们中国普通消费者这个角度来讲，我是要给老黄点一个大大的赞。虽然老黄一直刀法非常精准，一直坑我们这些个人玩家，在 AI 爆发之后也迅速抛弃了我们，对于我们可以说是一点情面都不留，但是如今他这一个发布会干得好。好在哪里呢？就是他把 A100、H100、H200 这些老的 GPU 直接干成了垃圾。如果说这些企业还继续用它们，说实话，还不值机房那点资源费用。说白了，这些老卡就早一点淘汰掉，抓紧上英伟达新的推理解决方案，上新的架构。</p>
<p dir="auto">把大量老卡退役下来干什么呢？成为洋垃圾，装上大船，发到哪里去？哪个国家出钱多，就发到哪个国家。毫无疑问，市场在中国。这些大船货上岸之后，第一时间就被中国的企业瓜分了，被小的算力中心瓜分了。它们愿意出更高的价格去挑更好的品质，那总会有一些歪瓜裂枣的沦落到闲鱼、拼夕夕，或者京东的二手店、淘宝的二手店，那么到时候就轮到我们手里了。</p>
<p dir="auto">我就再也不用每天伺候这个 3 万块钱的 4090D 48G 了，没有必要。A100 80G 它不香吗？如果能以白菜价买到这样的芯片，甚至如果有一天 H100、H200 都成为洋垃圾了，那我们本地玩家还不是玩出花来了？我们还去买什么云端 API？无论是视频还是大模型，在本地跑得都飞起了，干嘛要受云端的罪呢？自己想搞点什么涩涩的小剧情，也不用受什么限制，那多好啊！所以说我是必须给老黄点一个大大的赞。</p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/dc356664-809e-4d94-a108-2435f6bf81e0.webp" alt="A100 2.webp" class=" img-fluid img-markdown" /></p>
<p dir="auto">但是说实话，从这个生态的角度来讲，我觉得老黄做得有点过分了，有点贪心不足了，他越界了。他这样做只会进一步加强像 OpenAI、Meta，或者微软这样的大企业自研芯片的决心。马国公现在可能跟老黄达成了某些方面的协议，就是不断地去鼓吹英伟达的芯片。但是你要知道，马斯克的 AI，就他那个 Grok，就是跟狗屎一样，它永远不可能成为头部大模型。</p>
<p dir="auto">如果有一天，世界上头部的顶尖大模型，比如 OpenAI 的 GPT，或者 Anthropic 的 Claude，以及中国的 DeepSeek、Kimi 这些，如果有一天它们用的都不是英伟达的芯片，那你英伟达要怎么向世界解释你卖这么高价的理由呢？你做这件事情会反噬你自己的。</p>
<p dir="auto">当然了，我们不要认为自己比世界第一大企业的 CEO，比这个精准刀法大师老黄要更加精明。或许站在人家那个角度，人家早就看出来了，AI 泡沫破裂几乎是不可避免的。与其坐以待毙，不如在雪崩之前尽可能把自己的价值兑现，储备足够多的现金，然后应对即将到来的寒冬。</p>
<p dir="auto">我并非说 AI 本身是一个泡沫，而是美国的高估值 AI 是一个泡沫。我相信不仅是我看到了这一点，这些硅谷、华尔街的精英都看到了这一点，而且从他们各自的动作来看，可以非常明确地捕捉到这个信号：他们都在为有可能到来的寒冬做准备。春江水暖鸭先知，老黄一定是那个比较灵敏、跑在前面的鸭子，我们跟在后面捡漏就行了。</p>
<p dir="auto">这些大企业神仙打架，我们在旁边捡一些它们不要的残羹冷炙，捡一些二手的垃圾卡，到时候把自己的应用给跑起来，也享受一下 AI 带来的技术红利。</p>
]]></description><link>https://lcz.me/topic/1326</link><generator>RSS for Node</generator><lastBuildDate>Wed, 09 Sep 2026 22:53:39 GMT</lastBuildDate><atom:link href="https://lcz.me/topic/1326.rss" rel="self" type="application/rss+xml"/><pubDate>Wed, 26 Aug 2026 02:00:00 GMT</pubDate><ttl>60</ttl><item><title><![CDATA[Reply to 英伟达Rubin+Groq重磅发布：推理性能暴增30倍，成本降35倍，老黄却可能走了一步臭棋？ on Wed, 26 Aug 2026 03:25:11 GMT]]></title><description><![CDATA[<p dir="auto">这是一个大型的 gtx spark, rtx spark....</p>
]]></description><link>https://lcz.me/post/14006</link><guid isPermaLink="true">https://lcz.me/post/14006</guid><dc:creator><![CDATA[imbiplaza ASUS]]></dc:creator><pubDate>Wed, 26 Aug 2026 03:25:11 GMT</pubDate></item><item><title><![CDATA[Reply to 英伟达Rubin+Groq重磅发布：推理性能暴增30倍，成本降35倍，老黄却可能走了一步臭棋？ on Wed, 26 Aug 2026 02:56:58 GMT]]></title><description><![CDATA[<p dir="auto">毕竟刚买了自营的4090 48g 哈哈哈</p>
]]></description><link>https://lcz.me/post/13997</link><guid isPermaLink="true">https://lcz.me/post/13997</guid><dc:creator><![CDATA[zhenyu huang]]></dc:creator><pubDate>Wed, 26 Aug 2026 02:56:58 GMT</pubDate></item><item><title><![CDATA[Reply to 英伟达Rubin+Groq重磅发布：推理性能暴增30倍，成本降35倍，老黄却可能走了一步臭棋？ on Wed, 26 Aug 2026 02:53:07 GMT]]></title><description><![CDATA[<p dir="auto">短期内应该还是捡不到漏吧 不知道这个架构多久才能落地量产</p>
]]></description><link>https://lcz.me/post/13996</link><guid isPermaLink="true">https://lcz.me/post/13996</guid><dc:creator><![CDATA[zhenyu huang]]></dc:creator><pubDate>Wed, 26 Aug 2026 02:53:07 GMT</pubDate></item><item><title><![CDATA[Reply to 英伟达Rubin+Groq重磅发布：推理性能暴增30倍，成本降35倍，老黄却可能走了一步臭棋？ on Wed, 26 Aug 2026 02:00:00 GMT]]></title><description><![CDATA[<p dir="auto"><a href="https://youtu.be/DlE0CjmSfKU" rel="nofollow ugc"><i class="fa fa-youtube" aria-hidden="true"></i> Youtube Video</a></p><div class="js-lazyYT lazyYT-container" data-youtube-id="DlE0CjmSfKU" data-width="640" data-height="360" data-parameters style="width:640px;padding-bottom:360px">
 <div class="ytp-thumbnail lazyYT-image-loaded" style="background-image:url(&quot;https://i.ytimg.com/vi/DlE0CjmSfKU/hqdefault.jpg&quot;)">
  <button class="ytp-large-play-button ytp-button" tabindex="23" aria-live="assertive" style="transform:scale(0.85)" onclick="$(this).lazyYT(this);return false;">
   <svg height="100%" version="1.1" viewbox="0 0 68 48" width="100%">
    <path class="ytp-large-play-button-bg" d="m .66,37.62 c 0,0 .66,4.70 2.70,6.77 2.58,2.71 5.98,2.63 7.49,2.91 5.43,.52 23.10,.68 23.12,.68 .00,-1.3e-5 14.29,-0.02 23.81,-0.71 1.32,-0.15 4.22,-0.17 6.81,-2.89 2.03,-2.07 2.70,-6.77 2.70,-6.77 0,0 .67,-5.52 .67,-11.04 l 0,-5.17 c 0,-5.52 -0.67,-11.04 -0.67,-11.04 0,0 -0.66,-4.70 -2.70,-6.77 C 62.03,.86 59.13,.84 57.80,.69 48.28,0 34.00,0 34.00,0 33.97,0 19.69,0 10.18,.69 8.85,.84 5.95,.86 3.36,3.58 1.32,5.65 .66,10.35 .66,10.35 c 0,0 -0.55,4.50 -0.66,9.45 l 0,8.36 c .10,4.94 .66,9.45 .66,9.45 z" fill="#1f1f1e" fill-opacity="0.9">
    </path>
    <path d="m 26.96,13.67 18.37,9.62 -18.37,9.55 -0.00,-19.17 z" fill="#fff">
    </path>
    <path d="M 45.02,23.46 45.32,23.28 26.96,13.67 43.32,24.34 45.02,23.46 z" fill="#ccc">
    </path>
   </svg>
  </button>
 </div>
</div><p></p>
]]></description><link>https://lcz.me/post/13967</link><guid isPermaLink="true">https://lcz.me/post/13967</guid><dc:creator><![CDATA[terry]]></dc:creator><pubDate>Wed, 26 Aug 2026 02:00:00 GMT</pubDate></item></channel></rss>