英伟达Rubin+Groq重磅发布:推理性能暴增30倍,成本降35倍,老黄却可能走了一步臭棋?
-
很久没把我的笔记本拿出来了,这次是被迫拿出来。因为什么呢?老黄在本周开了一个重要的发布会,这里面的新名词太多,我这个老年痴呆的大脑基本上已经被干冒烟了,GPU 已经冒烟了,CPU 也冒烟了,也马上要烧掉了。没办法,我只有把笔记本端出来,照着念一下。当然我没有写稿子,我只是把这个发布会上的东西让 GPT 给整理了一下,我就照着念一下。
这个发布会是干什么呢?就是发布了新的 Rubin 架构 GPU,然后是新的 NVLink、机柜、新的 Groq 推理芯片,还有 Vera CPU,这一整套打包,并且还赠送了一个叫 Dynamo 的调度框架。这个框架干什么呢?它就负责 MoE 大模型的请求路由、KV Cache、Prefill、Decode、资源调度、扩容缩容等等。这件事情特别吊诡,老黄现在已经不仅仅想卖芯片了,卖芯片已经完全不能满足他了,他要卖一整套软硬件解决方案。
这套方案有什么恐怖之处呢?就是它在特定的 Agent workload 下,最高可以做到 30 倍的吞吐,在同样 1MW 能耗的情况下,Token 成本降低 35 倍。这样一整套的系统级优化,虽然它不是裸 GPU 性能提升 30 倍,但是已经非常恐怖了。Rubin 架构的 GPU,在传统的 BF16、FP32 这样的标准算力下,性能应该是提升了两倍;如果以自家的 NVFP4 这个特定格式来计算的话,性能可能提高了 4 倍左右到 5 倍的样子。但是这个不足以让这场发布会变得如此震撼,以至于我都想来讲一下,最重要的还是它这个所谓的整体解决方案,30 倍的吞吐提升,对 Agent 场景进行大幅度优化。老黄已经从大模型时代跳脱到 Agent 时代,从卖硬件转为卖解决方案。

这个事情怎么看呢?给大家举一个简单的例子。比如说现在 DeepSeek、Kimi,你们是什么呢?你们是刘一手,是海底捞。你们的后厨有一整套买菜、洗菜、切菜、上菜,还有前台收银、服务人员调度,包括店内用什么锅、用什么样子的装修风格,甚至海底捞还有一些额外的服务、才艺表演。这一整套解决方案其实门槛是比较高的。如果现在你是地主家的傻儿子,去海底捞吃了之后感觉味道挺不错,去刘一手吃了也觉得挺不错,那么你自己也想开个火锅店。但是你除了饭量比别人大、口袋里的钱比别人多,就没有什么优势了,可以说对开火锅店一窍不通。
那怎么办呢?老黄说,不要紧,你把钱给我。我现在有一个加盟方案,我的加盟方案干什么呢?就是说刘一手有的我都有,这一整套后厨体系,包括前台管理体系,包括如何选址、装修的标准,我都有。你只需要把店员招聘好,把选址给选好,把加盟费给我,剩下来的你就不用操心了,这一整套我帮你部署好,到时候你自己经营就行了。别人叫刘一手,我们就叫张一手、王一手、孙一手;别人叫海底捞,我们就湖底捞、河底捞,怎么捞不是捞,反正捞起来都能吃。
这件事情对于生态的影响有多大?有人说,这个方案出来之后,什么遥遥领先、华为完蛋了,国产这些 AI 芯片企业完蛋了,它们活不下去了,将来将成为笑话。我怎么讲?这一块影响的是推理市场,而且影响的是美国的推理市场。因为老黄的芯片、解决方案无论再怎么先进,它卖不到国内来,我们国内有钱也买不到。所以什么华为、海光这些国产 AI 算力解决方案,它们不用担心,它们再怎么说在国内这个市场是没有问题的。

第二,这个东西影响的是推理市场,它对于训练市场是没有多大影响的。比如说遥遥领先现在不是要出什么 950DT 吗?它提供的是光互联的解决方案,就是它在机柜性能上面、在单芯片性能上面,毫无疑问被英伟达吊打。但是它这个光互联方案一旦上升到万卡集群,甚至 10 万卡集群,华为在光互联方面的技术确实要遥遥领先于英伟达。这一块用华为自己的话来讲,就是华为在未来几年都会保持全球 AI 算力第一的宝座。这不是吹牛逼,它也是在特定的场景下。既然你老黄喜欢用特定场景,那我华为也是在特定场景,就是我的机柜规模比你更大,我的集群规模远比你大,暴力出奇迹。那么我就用更多的 GPU、更高的能耗,堆出比你英伟达更厉害的集群。
而且训练市场说实话,玩家就那么十几家,十家八家头部企业。也不是所有的企业玩 AI 都要去训练模型,它们更多的就是推理。所以训练这一块,我觉得老黄可能也认识到了,芯片性能再强,下游企业也不可能隔个两三年就迭代一次,因为没有必要。尤其是 MoE 架构出来之后,它参数再大,也不是所有参数一定要同时训练的。它只要把主干跟路由部分训练好,然后其他的专家可以分开训练。没有必要一定采用那么先进的 GPU,也没有必要一定把这个集群隔个两年就换掉,这个成本是非常高的。
但是推理市场就不一样了。推理市场还是一个蓝海市场,是一个增量市场,这个市场的潜力还非常大,有非常多的玩家想要进入这个市场。但是由于门槛有点高,或者由于算力不够、供应不够,这些企业可能就进不来。举个简单的例子,比如 Together AI 这种第三方算力贩子,像 OpenRouter 这种 AI 聚合平台,像 Hugging Face,它们都想建立自己的算力中心,都想用 DeepSeek、千问这样的开源大模型来搭建自己的算力。但是你叫它们像 OpenAI 那样去花几十亿美金、上百亿美金,甚至跟英伟达签订几千亿美金的长期供货合同,你觉得它们有这个本钱吗?它们连想都不敢想,这个门槛太高了,它们搞不定。
再比如说像 Uber,像我之前提到的一些金融企业、医药企业,它们也想建立自己的私有 AI 中心。但是它们肯定不想去训练大模型,它们只想下载一些开源大模型,自己做个蒸馏、微调,然后自己再搭建一套 Agent 系统。对于它们来讲,它们是愿意花钱的,花钱的欲望也很强,但是它们不会去搞训练。现在老黄很简单了:你也不要去买什么 AMD 的 CPU、英特尔的 CPU 了,也不要去搞什么开源框架了。你要折腾什么 SGLang、vLLM,还得下这个大模型、那个大模型,去考虑路由怎么处理、KV Cache 怎么处理、Prefill 和 Decode 怎么分配、资源怎么调度、怎么扩容缩容,这个太复杂了,你不用考虑了,你就把钱给我。

剩下来的就是你把机房选好,我把我的机柜送过来,解决方案给你挑好。你自己想怎么微调就怎么微调,我把调试方案给你出一个 PDF,再出个文档,你让你自己的工程师来看就行了。有什么问题,打电话给我英伟达的工程师,其他的事情你就不用搞了。然后英伟达挣你什么钱呢?挣你硬件的钱,挣你解决方案的钱。当然最主要的还是挣硬件的钱,解决方案未来肯定非常挣钱,但是现在对于老黄来说,他最大的目标还是要打开硬件的市场需求,把自己的卡尽可能卖出去。
但是我们要知道,这个东西说白了毕竟是山寨,就是英伟达做的是统一的解决方案,你不可能比大模型企业自家做得好。比如说你山寨一个 DeepSeek,你的效率能干得过 DeepSeek 自己吗?那不可能。DeepSeek 的效率之所以这么高,官方 API 为什么这么便宜,就是因为它做了比如 Engram,它的显存、内存、SSD 三层缓存方案,然后有什么 HCA、CSA 这样的注意力机制。从大模型到 Agent,人家都是自己开发的,所以这一整套系统下来,它的效率非常高,成本就能够压到很低。英伟达是做不到 DeepSeek 这个程度的,但是它可以做到 DeepSeek 官方比如 50%、60%,甚至 80% 的效率,这就非常够了。

因为对于美国企业来讲,如果请求 DeepSeek 官方 API,可能有法律风险,可能有政治风险,它可能就会考虑这个风险。如果说它自建,或者调用的是 Together AI、Hugging Face 或者 OpenRouter 这种美国平台,数据不出美国,那么这些企业可能就不担心了。老黄的目标也从来不是要把 DeepSeek、Kimi、GLM 这种开源大模型给干死。他就很简单,自己也自研大模型,但是我不能保证比这些开源大模型更先进。他自家的大模型叫什么?Nemotron。那个大模型做得真的是一言难尽,就是免费挂在 OpenRouter 上,然后调用量也只能说勉强看得过去。你想一想,完全免费白嫖,结果都是门可罗雀,你想这得有多丑。

这件事情对于英伟达来说,确实是大赚特赚的事情,可是它对于美国的 AI 产业来说,我觉得是一剂毒药,而且是非常大的毒药。首先,美国 AI 的龙头企业支撑了这个产业的繁荣,比如 Anthropic、OpenAI、Grok、谷歌,包括 Meta 的 Muse,这些头部模型消耗了大量的英伟达 GPU,把这个市场的估值不断抬高。然后你像 OpenAI,它们不仅现在采购大量 GPU,未来还有相当长的年限要绑定,必须承诺采购英伟达的 GPU,而且这个数量是相当惊人的。
它们研发这些大模型是要花很多钱的,而且这些企业都还没有赚钱,都还在亏损的情况下。Anthropic 可能说略微赚了点钱,但是那也是财报做下来的,总体上它肯定还是亏损的。就在这些头部大模型企业还没有赚钱的时候,你把大模型的门槛突然间打到了地板上。像这些算力贩子,它们可以用你 1/10,甚至 1% 的价格去提供 DeepSeek。比如 OpenAI、Anthropic,你们的模型是 100 分,那我的 DeepSeek 是 85 分、90 分,但是我的成本是你的 1/10。
这件事情以前可以说,Kimi、GLM、DeepSeek 是中国模型,你的数据要去中国,不安全。美国公司可能有这样那样的疑问,Anthropic 和 OpenAI 可以大肆宣传说这样不安全,那有一部分企业可能会买单。但是如今你把这个门槛打到地板上之后,这个模型是开源的,然后开源社区证明它是安全的,并且它是可控的,你可以二次蒸馏、微调、改进,然后把它部署到美国的服务器上。还有你说这些 Anthropic 也好,OpenAI 也好,它们开发这个大模型想干什么?它们想卖给谁?难道都是卖给你我这样的屌丝吗?一个月 10 美金、20 美金这样的订阅费用,对于它们来说是不少,但是已经可以看到它的上限就那么多了,它的成长故事性并不强。

它们那么高的估值,万亿级别美元的市场估值来自于哪里?大部分是来自于企业。它们想去做 Uber,想去做熊猫送餐,想去做这些大型 IT 企业的供应商。但是你现在推出这么个玩意之后,如果你是 Uber 的 CEO,你会愿意倾向于自己采购,去装 DeepSeek,还是说去采购昂贵的 Anthropic 或者 OpenAI 的大模型呢?你玩了一招釜底抽薪。是的,你英伟达是安全了,你的芯片卖得多了,整个生态也繁荣了,你的皮夹克穿上去之后,每年都能讲新的故事,那这些曾经跟你一起打天下的老哥们怎么办?
你要知道,它们曾经花了百亿美元、几百亿美元,甚至上千亿美元去购买你这个昂贵的 GPU。H100、H200 这样的老 GPU,现在还在它们的分摊账单上面。本来一张卡正常情况下应该算是 3 年折旧,但是由于你的卡太贵了,这些大企业不得不把你的卡分摊到 6 年,甚至 7 年、8 年。对于它们来说,H100、H200,包括 B200、B300,现在还在资产负债表上,还没下去呢。结果不到两年的时间,你一个 Rubin 架构出来之后,搭配 Groq,加上新的 NVLink、Vera CPU,还有 Dynamo 调度框架,我操,你是把自己电到高潮了,你的这些老哥们怎么办?那不是泪流满面吗?
还有现在说白了,中美两国的 AI 战争、芯片战争,其实最终看的是什么?就是一个现象、一个结果、一个标准:谁的大模型能够笑到最后。而中国不需要做到比美国优秀,只需要做到保持你美国 100 分,我是 95 分就行。如果说有一天,美国这些头部 AI 大模型企业因为老黄这么瞎搞,失去了自己的利基市场,输掉了 AI 大模型头部竞争,世界头部的大模型变成了 DeepSeek,变成了 Kimi,变成了中国大模型,你们有没有想过这个后果呢?
你美元霸权绑定的是科技霸权,包括你的军事霸权,其实一切的一切,根源还是你的科技霸权。如果说你的科技上面被中国超越了,那么全世界对美国的信心会出现崩塌。美国当世界老大,全世界这些中立国家,或者说美国的小弟们,是能够接受一种叙事的:中国是一个特别牛逼的国家,但是美国是 100 分,中国永远是追赶者,中国是 90 分。我永远跟着 100 分混,这个是没有错的选择。可是如果有一天他们发现,100 分是中国,你美国是 99 分,那这个影响是灾难性的。

你别忘了,在工业实力上面,你跟中国现在已经不在一个级别了,你跟中国已经没法竞争了,中国的工业实力是你的好几倍。如果说你再输掉科技战,你这美元靠什么来支撑?靠你那存量的 11 艘航母吗?你不觉得这是个笑话吗?
那站在我们中国普通消费者这个角度来讲,我是要给老黄点一个大大的赞。虽然老黄一直刀法非常精准,一直坑我们这些个人玩家,在 AI 爆发之后也迅速抛弃了我们,对于我们可以说是一点情面都不留,但是如今他这一个发布会干得好。好在哪里呢?就是他把 A100、H100、H200 这些老的 GPU 直接干成了垃圾。如果说这些企业还继续用它们,说实话,还不值机房那点资源费用。说白了,这些老卡就早一点淘汰掉,抓紧上英伟达新的推理解决方案,上新的架构。
把大量老卡退役下来干什么呢?成为洋垃圾,装上大船,发到哪里去?哪个国家出钱多,就发到哪个国家。毫无疑问,市场在中国。这些大船货上岸之后,第一时间就被中国的企业瓜分了,被小的算力中心瓜分了。它们愿意出更高的价格去挑更好的品质,那总会有一些歪瓜裂枣的沦落到闲鱼、拼夕夕,或者京东的二手店、淘宝的二手店,那么到时候就轮到我们手里了。
我就再也不用每天伺候这个 3 万块钱的 4090D 48G 了,没有必要。A100 80G 它不香吗?如果能以白菜价买到这样的芯片,甚至如果有一天 H100、H200 都成为洋垃圾了,那我们本地玩家还不是玩出花来了?我们还去买什么云端 API?无论是视频还是大模型,在本地跑得都飞起了,干嘛要受云端的罪呢?自己想搞点什么涩涩的小剧情,也不用受什么限制,那多好啊!所以说我是必须给老黄点一个大大的赞。

但是说实话,从这个生态的角度来讲,我觉得老黄做得有点过分了,有点贪心不足了,他越界了。他这样做只会进一步加强像 OpenAI、Meta,或者微软这样的大企业自研芯片的决心。马国公现在可能跟老黄达成了某些方面的协议,就是不断地去鼓吹英伟达的芯片。但是你要知道,马斯克的 AI,就他那个 Grok,就是跟狗屎一样,它永远不可能成为头部大模型。
如果有一天,世界上头部的顶尖大模型,比如 OpenAI 的 GPT,或者 Anthropic 的 Claude,以及中国的 DeepSeek、Kimi 这些,如果有一天它们用的都不是英伟达的芯片,那你英伟达要怎么向世界解释你卖这么高价的理由呢?你做这件事情会反噬你自己的。
当然了,我们不要认为自己比世界第一大企业的 CEO,比这个精准刀法大师老黄要更加精明。或许站在人家那个角度,人家早就看出来了,AI 泡沫破裂几乎是不可避免的。与其坐以待毙,不如在雪崩之前尽可能把自己的价值兑现,储备足够多的现金,然后应对即将到来的寒冬。
我并非说 AI 本身是一个泡沫,而是美国的高估值 AI 是一个泡沫。我相信不仅是我看到了这一点,这些硅谷、华尔街的精英都看到了这一点,而且从他们各自的动作来看,可以非常明确地捕捉到这个信号:他们都在为有可能到来的寒冬做准备。春江水暖鸭先知,老黄一定是那个比较灵敏、跑在前面的鸭子,我们跟在后面捡漏就行了。
这些大企业神仙打架,我们在旁边捡一些它们不要的残羹冷炙,捡一些二手的垃圾卡,到时候把自己的应用给跑起来,也享受一下 AI 带来的技术红利。
-
短期内应该还是捡不到漏吧 不知道这个架构多久才能落地量产
-
短期内应该还是捡不到漏吧 不知道这个架构多久才能落地量产
毕竟刚买了自营的4090 48g 哈哈哈
-
这是一个大型的 gtx spark, rtx spark....