DeepSeek V4 Flash爆火,调用量破纪录,但是梁文锋谈话泄露华为芯片短期内供货不足,V5训练还得仰仗英伟达算力集群,会被CUDA生态锁死吗?
-
在上期的视频评论区,有网友留言说他比较认同我关于中美两国 AI 大模型竞争态势的判断,即中国的大模型可能会以极低的价格和极致的性价比在竞争中占据优势地位;但他不太认同我关于两国硬件竞争的预判。他认为英伟达的 CUDA 生态护城河依然非常深,专利壁垒极强,中国企业尤其是华为想要突破是比较困难的。那么本期视频,我们就继续讨论一下这个话题。

前几天,DeepSeek V4 Flash 正式版发布之后掀起了一股狂热的旋风,似乎整个网络都在使用。在 8 月 1 日,OpenCode 这款 AI 编程工具仅在单个平台就消耗了 8 万亿 tokens,这是一个非常恐怖的量。其中有 5 万亿是优惠引流,另外 3 万亿是用户自费购买。这是一个什么样的概念呢?全球最大的 AI 聚合平台 OpenRouter.ai 上面几百个模型,单日的 tokens 总消耗量大概是 6.6 万亿。也就是说,OpenCode 这一个软件就超过了它整个平台的调用量。而且即便是在 OpenRouter.ai 上,排名第一的也是 DeepSeek V4 Flash,DeepSeek V4 Pro 也进入了前几名。再加上 DeepSeek 官方 API 的调用,以及庞大的第三方 DeepSeek 部署,可以说 DeepSeek 毫无疑问就是当下 AI 开源领域的王者。

这位网友还提到了 DeepSeek 与投资人会议的录音,现在在网上被人转化成了 PDF 文件。我本来是不太相信这些边角料新闻的,因为这个 PDF 我早就看过。但是我今天搜索了一下网络,发现这个 PDF 在国内已经搜不到了,并且在豆包上也已经没有人谈论这个话题,如果你问它,它也会拒绝回答。这让我更加相信这件事可能是真的。
我又去认真看了一下那个文件。梁文锋认为,当下 DeepSeek 跟美国 AI 顶尖梯队的差距大概在一到两年的时间,他的目标是将差距缩小到半年甚至三个月,但要以 1/20 的成本去做到这一切。不过从 DeepSeek V4 Flash 正式版发布后的表现来看,梁文锋已经提前做到了,当下两者的差距大概就在半年左右。中国的一些顶级模型,比如 Kimi K3,它的跑分已经是跟 Claude Fabo5 达到了同一个档次,差距可能已经小于三个月了。
但是这只是当下,虽然我们看到中国的 AI 大模型非常红火,不仅在文本和通用大模型方面,在多模态领域,字节跳动的 Seedance 2.5 以及 MiniMax 最新开源的 H3,都掀起了互联网的讨论狂潮,可以说是好评如潮。

但事实上,中国的大模型确实是有危机的。就像梁文锋自己说的,他打算在今年年底去训练新一代的大模型(可能是 DeepSeek V5),目标是激活 150B 参数。那么当下的 DeepSeek V4 Pro 是一个什么样的水平呢?它是 1.4 万亿参数,但激活量只有 50B(大概 49B)。如果激活量要提升三倍的话,意味着模型整体规模可能会在 3 万亿到 4 万亿参数之间,这对算力的要求非常高。
当下中国最大的模型是 Kimi K3,参数大概在 2.7 万亿左右(在 2 万亿到 3 万亿之间),这还是要比美国模型小一半。美国的主流模型,无论是 xAI、Anthropic 还是 OpenAI,大概都在 5 万亿参数之上或附近,它们激活的参数同时都是几百 B。
要在今年年底去训练激活量为 150B 参数的新一代 DeepSeek 模型,目前我们知道的是,在美方禁令生效之前,DeepSeek 囤积了大概相当于 2 万张英伟达 A100 或 A800 芯片的集群算力。后来它有没有通过其他灰色渠道购买到新芯片,我们不得而知;仅从官方公布的数据来看,这些芯片是不足以同时支撑超大规模模型的训练和推理的。

不过今年华为确实开始加速向 DeepSeek 供货(即 950PR 推理芯片)。根据梁文锋自己的说法,华为大概给了他 16,000 张左右的芯片配额,这大概只相当于四五千张英伟达芯片,对于总体算力的缓解其实完全不够。但是 DeepSeek 也很想配合华为把生态做好,所以也在积极配合。如果今年能够加大供应,供应越多的华为 950PR,DeepSeek 就能够把更多的英伟达芯片解放出来,组建集群去训练下一代的 DeepSeek V5。
华为在今年四季度的年底,会向用户小批量交付 950DT 训练芯片。如果要上量的话,我估计要到明年之后了,这肯定是远水解不了近渴,DeepSeek 不可能等到华为 950DT 大批量交付之后才开始 V5 的训练。所以 DeepSeek 下一代主力模型的训练依然会基于英伟达架构,950DT 即便交付了,可能也只是承担一些辅助训练任务。
目前完全基于华为昇腾 910B/910C 国产生态训练的模型,有万亿参数的美团 LongCat 以及 7,440 亿参数的 GLM 5.2。虽然它们的跑分和评价都还不错,但毕竟参数总量还是比美国的模型小得多。
那么,是不是我们当下国产 AI 生态就会被英伟达给锁死呢?其实完全不是这样。就在那个会议录音的 PDF 文件里,梁文锋其实给出了完全相反的看法。梁文锋并不认为英伟达具备什么高深的护城河,其 CUDA 也不是什么不可超越的神话。事实上,DeepSeek 在早期曾经手写过 PTX(英伟达的汇编指令)去优化 CUDA 算子,但在 V3 和 V4 版本中,他们已经是使用国产的 TileLang 高级语言去写中间件了。也就是说,他们是用 TileLang 写的中间件去对接 PyTorch 以及底层的 ROCm、CUDA 或华为的 CANN 架构。目前这个工作根据梁文锋自己的说法已经是完成了大部分,可能还有一小部分没有完成,但可以确定 DeepSeek 是能够完全完成的。

也就是说,即便是下一代的主力模型依然使用英伟达的旧卡生态来训练,也不妨碍等华为芯片的供应量充足之后,平滑地迁移到华为的训练集群上来。当然,中间难免有一些阵痛,就像这一次推理转换到华为 950PR 芯片带来的阵痛一样。有阵痛就会有收获,现在 DeepSeek 能够以这么低的价格承担这么庞大的用量请求,华为昇腾芯片可以说也交出了满意的答卷。
目前,中国的 DUV 已经完成了技术攻关,无论是干式还是浸润式的都投入了量产。EUV 光刻机之前传出造出了工程样机但没有流片成功,这是很早之前的传闻了,到现在我个人认为应当是流片成功并打通了整个流程,但是距离量产还是有比较远的距离。具体突破到什么程度,我们除了关注一些小道消息和花边新闻,还是要等待权威消息公布。
有的观众在视频下方留言说:如果华为能够通过落后制程的芯片,通过堆更大规模的集群来产生更大的算力,那么英伟达为什么不能这样做呢?他还特别提到英伟达的 NVLink 在今年四季度又要发布新产品,整个机柜的性能又有大大提升。
但是我想说,NVLink 本质上依然是电互联技术,传输的还是电信号,走的是铜缆。这一块无论怎么折腾、怎么提升效率,也只能提升一个小小的机柜。如果扩展到万卡集群,最终还是要走光互联方案。而在光互联这一块,华为的技术积累要远远强于英伟达。华为是做通信技术起家的,是世界上排名第一、远超第二名的通信企业,当年是从激烈的红海竞争中一路尸山血海杀过来的,先后击败了爱立信、诺基亚、摩托罗拉、思科等通信巨头。

华为走到今天这一步,付出了很大的代价,花了很长的时间。如果说中国突破西方的技术限制需要很长时间,那么西方想要在光互联技术上去赶上中国企业,其实也是比较困难的。目前世界排名靠前的几个光模块企业其实都是中国的。西方的 1.6T 光模块产品还在实验室阶段,还没有完全走入量产;而中国的 1.6T 光模块早就量产了,甚至 2.4T、3.2T 的产品已经研发完毕并送样华为,马上就要投入量产。这一块的差距是非常明显的。面对困难我们要实事求是,但我们也不至于妄自菲薄,有优势的地方还是要保持战略自信。
最后,我非常想开一个直播系列。因为我这个人是个嘴炮,就喜欢跟别人抬杠,但像现在这样对着镜头一个人讲实在不过瘾。你们在评论区打字,我在镜头前瞎聊,不够给劲。我在考虑要不要找一个语音软件,然后在论坛发个帖子让大家报名,到时候大家聚在一起聊聊天、切磋一下。或许在现场的一问一答中,更能表达清楚自己的想法。
先看着办吧,我得先锻炼一下自己面对镜头的能力。像老梁、王局他们,对着镜头娓娓道来,整个视频可能一刀未剪;而我做完一个视频,怎么也得剪个几十刀。先把这个能力锻炼上来吧。
在上期的视频评论区,有网友留言说他比较认同我关于中美两国 AI 大模型竞争态势的判断,即中国的大模型可能会以极低的价格和极致的性价比在竞争中占据优势地位;但他不太认同我关于两国硬件竞争的预判。他认为英伟达的 CUDA 生态护城河依然非常深,专利壁垒极强,中国企业尤其是华为想要突破是比较困难的。那么本期视频,我们就继续讨论一下这个话题。

前几天,DeepSeek V4 Flash 正式版发布之后掀起了一股狂热的旋风,似乎整个网络都在使用。在 8 月 1 日,OpenCode 这款 AI 编程工具仅在单个平台就消耗了 8 万亿 tokens,这是一个非常恐怖的量。其中有 5 万亿是优惠引流,另外 3 万亿是用户自费购买。这是一个什么样的概念呢?全球最大的 AI 聚合平台 OpenRouter.ai 上面几百个模型,单日的 tokens 总消耗量大概是 6.6 万亿。也就是说,OpenCode 这一个软件就超过了它整个平台的调用量。而且即便是在 OpenRouter.ai 上,排名第一的也是 DeepSeek V4 Flash,DeepSeek V4 Pro 也进入了前几名。再加上 DeepSeek 官方 API 的调用,以及庞大的第三方 DeepSeek 部署,可以说 DeepSeek 毫无疑问就是当下 AI 开源领域的王者。

这位网友还提到了 DeepSeek 与投资人会议的录音,现在在网上被人转化成了 PDF 文件。我本来是不太相信这些边角料新闻的,因为这个 PDF 我早就看过。但是我今天搜索了一下网络,发现这个 PDF 在国内已经搜不到了,并且在豆包上也已经没有人谈论这个话题,如果你问它,它也会拒绝回答。这让我更加相信这件事可能是真的。
我又去认真看了一下那个文件。梁文锋认为,当下 DeepSeek 跟美国 AI 顶尖梯队的差距大概在一到两年的时间,他的目标是将差距缩小到半年甚至三个月,但要以 1/20 的成本去做到这一切。不过从 DeepSeek V4 Flash 正式版发布后的表现来看,梁文锋已经提前做到了,当下两者的差距大概就在半年左右。中国的一些顶级模型,比如 Kimi K3,它的跑分已经是跟 Claude Fabo5 达到了同一个档次,差距可能已经小于三个月了。
但是这只是当下,虽然我们看到中国的 AI 大模型非常红火,不仅在文本和通用大模型方面,在多模态领域,字节跳动的 Seedance 2.5 以及 MiniMax 最新开源的 H3,都掀起了互联网的讨论狂潮,可以说是好评如潮。

但事实上,中国的大模型确实是有危机的。就像梁文锋自己说的,他打算在今年年底去训练新一代的大模型(可能是 DeepSeek V5),目标是激活 150B 参数。那么当下的 DeepSeek V4 Pro 是一个什么样的水平呢?它是 1.4 万亿参数,但激活量只有 50B(大概 49B)。如果激活量要提升三倍的话,意味着模型整体规模可能会在 3 万亿到 4 万亿参数之间,这对算力的要求非常高。
当下中国最大的模型是 Kimi K3,参数大概在 2.7 万亿左右(在 2 万亿到 3 万亿之间),这还是要比美国模型小一半。美国的主流模型,无论是 xAI、Anthropic 还是 OpenAI,大概都在 5 万亿参数之上或附近,它们激活的参数同时都是几百 B。
要在今年年底去训练激活量为 150B 参数的新一代 DeepSeek 模型,目前我们知道的是,在美方禁令生效之前,DeepSeek 囤积了大概相当于 2 万张英伟达 A100 或 A800 芯片的集群算力。后来它有没有通过其他灰色渠道购买到新芯片,我们不得而知;仅从官方公布的数据来看,这些芯片是不足以同时支撑超大规模模型的训练和推理的。

不过今年华为确实开始加速向 DeepSeek 供货(即 950PR 推理芯片)。根据梁文锋自己的说法,华为大概给了他 16,000 张左右的芯片配额,这大概只相当于四五千张英伟达芯片,对于总体算力的缓解其实完全不够。但是 DeepSeek 也很想配合华为把生态做好,所以也在积极配合。如果今年能够加大供应,供应越多的华为 950PR,DeepSeek 就能够把更多的英伟达芯片解放出来,组建集群去训练下一代的 DeepSeek V5。
华为在今年四季度的年底,会向用户小批量交付 950DT 训练芯片。如果要上量的话,我估计要到明年之后了,这肯定是远水解不了近渴,DeepSeek 不可能等到华为 950DT 大批量交付之后才开始 V5 的训练。所以 DeepSeek 下一代主力模型的训练依然会基于英伟达架构,950DT 即便交付了,可能也只是承担一些辅助训练任务。
目前完全基于华为昇腾 910B/910C 国产生态训练的模型,有万亿参数的美团 LongCat 以及 7,440 亿参数的 GLM 5.2。虽然它们的跑分和评价都还不错,但毕竟参数总量还是比美国的模型小得多。
那么,是不是我们当下国产 AI 生态就会被英伟达给锁死呢?其实完全不是这样。就在那个会议录音的 PDF 文件里,梁文锋其实给出了完全相反的看法。梁文锋并不认为英伟达具备什么高深的护城河,其 CUDA 也不是什么不可超越的神话。事实上,DeepSeek 在早期曾经手写过 PTX(英伟达的汇编指令)去优化 CUDA 算子,但在 V3 和 V4 版本中,他们已经是使用国产的 TileLang 高级语言去写中间件了。也就是说,他们是用 TileLang 写的中间件去对接 PyTorch 以及底层的 ROCm、CUDA 或华为的 CANN 架构。目前这个工作根据梁文锋自己的说法已经是完成了大部分,可能还有一小部分没有完成,但可以确定 DeepSeek 是能够完全完成的。

也就是说,即便是下一代的主力模型依然使用英伟达的旧卡生态来训练,也不妨碍等华为芯片的供应量充足之后,平滑地迁移到华为的训练集群上来。当然,中间难免有一些阵痛,就像这一次推理转换到华为 950PR 芯片带来的阵痛一样。有阵痛就会有收获,现在 DeepSeek 能够以这么低的价格承担这么庞大的用量请求,华为昇腾芯片可以说也交出了满意的答卷。
目前,中国的 DUV 已经完成了技术攻关,无论是干式还是浸润式的都投入了量产。EUV 光刻机之前传出造出了工程样机但没有流片成功,这是很早之前的传闻了,到现在我个人认为应当是流片成功并打通了整个流程,但是距离量产还是有比较远的距离。具体突破到什么程度,我们除了关注一些小道消息和花边新闻,还是要等待权威消息公布。
有的观众在视频下方留言说:如果华为能够通过落后制程的芯片,通过堆更大规模的集群来产生更大的算力,那么英伟达为什么不能这样做呢?他还特别提到英伟达的 NVLink 在今年四季度又要发布新产品,整个机柜的性能又有大大提升。
但是我想说,NVLink 本质上依然是电互联技术,传输的还是电信号,走的是铜缆。这一块无论怎么折腾、怎么提升效率,也只能提升一个小小的机柜。如果扩展到万卡集群,最终还是要走光互联方案。而在光互联这一块,华为的技术积累要远远强于英伟达。华为是做通信技术起家的,是世界上排名第一、远超第二名的通信企业,当年是从激烈的红海竞争中一路尸山血海杀过来的,先后击败了爱立信、诺基亚、摩托罗拉、思科等通信巨头。

华为走到今天这一步,付出了很大的代价,花了很长的时间。如果说中国突破西方的技术限制需要很长时间,那么西方想要在光互联技术上去赶上中国企业,其实也是比较困难的。目前世界排名靠前的几个光模块企业其实都是中国的。西方的 1.6T 光模块产品还在实验室阶段,还没有完全走入量产;而中国的 1.6T 光模块早就量产了,甚至 2.4T、3.2T 的产品已经研发完毕并送样华为,马上就要投入量产。这一块的差距是非常明显的。面对困难我们要实事求是,但我们也不至于妄自菲薄,有优势的地方还是要保持战略自信。
最后,我非常想开一个直播系列。因为我这个人是个嘴炮,就喜欢跟别人抬杠,但像现在这样对着镜头一个人讲实在不过瘾。你们在评论区打字,我在镜头前瞎聊,不够给劲。我在考虑要不要找一个语音软件,然后在论坛发个帖子让大家报名,到时候大家聚在一起聊聊天、切磋一下。或许在现场的一问一答中,更能表达清楚自己的想法。
先看着办吧,我得先锻炼一下自己面对镜头的能力。像老梁、王局他们,对着镜头娓娓道来,整个视频可能一刀未剪;而我做完一个视频,怎么也得剪个几十刀。先把这个能力锻炼上来吧。
-
在deepseek R1出现的时候,资本市场就对这场竞争给了结论性的回应,大模型的护城河并不高,美国的公司无法一枝独秀。当然这个护城河“不高”是有前提的,就是玩家得能够入围所谓的“斩杀线”,人才,电力,芯片都得具备,才有当玩家的资格。
国内的模型能力能跟住第一梯队,离不开自己的电力和人才储备,还有一个重要因素来自对美国模型的蒸馏。所有模型的训练,都需要有高质量的数据,数据清洗的过程普遍依赖人工标注的,特别是科学类的论文,而蒸馏是获得高质量标注数据的捷径。换句话讲,国内模型的进步很大程度上被美国模型拉着进步的。
未来芯片问题终究会被解决,决定竞争胜负终究会是性价比,openai和anthropic都不是未来国内玩家的主要对手,毕竟在一个维度上竞争,全世界都不是国货的对手,这个在电动车领域已经体现的淋漓精致了。国内公司真正的对手来自spaceX,太空算力中心30万亿美金的故事才是最大的威胁,老马的愿望万一实现了,才是真正的“维度”竞争,这个方案的核心是占据特定的卫星轨道资源,这种特殊的轨道资源是有限的,先到先得,目前spaceX的单公斤发射成本还是国内的20分之一左右,有望拉到百分之一的差距数量级,这种差距不是2年能赶上来的,因此spaceX才是未来国内公司最大的竞争对手。 -
在deepseek R1出现的时候,资本市场就对这场竞争给了结论性的回应,大模型的护城河并不高,美国的公司无法一枝独秀。当然这个护城河“不高”是有前提的,就是玩家得能够入围所谓的“斩杀线”,人才,电力,芯片都得具备,才有当玩家的资格。
国内的模型能力能跟住第一梯队,离不开自己的电力和人才储备,还有一个重要因素来自对美国模型的蒸馏。所有模型的训练,都需要有高质量的数据,数据清洗的过程普遍依赖人工标注的,特别是科学类的论文,而蒸馏是获得高质量标注数据的捷径。换句话讲,国内模型的进步很大程度上被美国模型拉着进步的。
未来芯片问题终究会被解决,决定竞争胜负终究会是性价比,openai和anthropic都不是未来国内玩家的主要对手,毕竟在一个维度上竞争,全世界都不是国货的对手,这个在电动车领域已经体现的淋漓精致了。国内公司真正的对手来自spaceX,太空算力中心30万亿美金的故事才是最大的威胁,老马的愿望万一实现了,才是真正的“维度”竞争,这个方案的核心是占据特定的卫星轨道资源,这种特殊的轨道资源是有限的,先到先得,目前spaceX的单公斤发射成本还是国内的20分之一左右,有望拉到百分之一的差距数量级,这种差距不是2年能赶上来的,因此spaceX才是未来国内公司最大的竞争对手。 -
-
在上期的视频评论区,有网友留言说他比较认同我关于中美两国 AI 大模型竞争态势的判断,即中国的大模型可能会以极低的价格和极致的性价比在竞争中占据优势地位;但他不太认同我关于两国硬件竞争的预判。他认为英伟达的 CUDA 生态护城河依然非常深,专利壁垒极强,中国企业尤其是华为想要突破是比较困难的。那么本期视频,我们就继续讨论一下这个话题。

前几天,DeepSeek V4 Flash 正式版发布之后掀起了一股狂热的旋风,似乎整个网络都在使用。在 8 月 1 日,OpenCode 这款 AI 编程工具仅在单个平台就消耗了 8 万亿 tokens,这是一个非常恐怖的量。其中有 5 万亿是优惠引流,另外 3 万亿是用户自费购买。这是一个什么样的概念呢?全球最大的 AI 聚合平台 OpenRouter.ai 上面几百个模型,单日的 tokens 总消耗量大概是 6.6 万亿。也就是说,OpenCode 这一个软件就超过了它整个平台的调用量。而且即便是在 OpenRouter.ai 上,排名第一的也是 DeepSeek V4 Flash,DeepSeek V4 Pro 也进入了前几名。再加上 DeepSeek 官方 API 的调用,以及庞大的第三方 DeepSeek 部署,可以说 DeepSeek 毫无疑问就是当下 AI 开源领域的王者。

这位网友还提到了 DeepSeek 与投资人会议的录音,现在在网上被人转化成了 PDF 文件。我本来是不太相信这些边角料新闻的,因为这个 PDF 我早就看过。但是我今天搜索了一下网络,发现这个 PDF 在国内已经搜不到了,并且在豆包上也已经没有人谈论这个话题,如果你问它,它也会拒绝回答。这让我更加相信这件事可能是真的。
我又去认真看了一下那个文件。梁文锋认为,当下 DeepSeek 跟美国 AI 顶尖梯队的差距大概在一到两年的时间,他的目标是将差距缩小到半年甚至三个月,但要以 1/20 的成本去做到这一切。不过从 DeepSeek V4 Flash 正式版发布后的表现来看,梁文锋已经提前做到了,当下两者的差距大概就在半年左右。中国的一些顶级模型,比如 Kimi K3,它的跑分已经是跟 Claude Fabo5 达到了同一个档次,差距可能已经小于三个月了。
但是这只是当下,虽然我们看到中国的 AI 大模型非常红火,不仅在文本和通用大模型方面,在多模态领域,字节跳动的 Seedance 2.5 以及 MiniMax 最新开源的 H3,都掀起了互联网的讨论狂潮,可以说是好评如潮。

但事实上,中国的大模型确实是有危机的。就像梁文锋自己说的,他打算在今年年底去训练新一代的大模型(可能是 DeepSeek V5),目标是激活 150B 参数。那么当下的 DeepSeek V4 Pro 是一个什么样的水平呢?它是 1.4 万亿参数,但激活量只有 50B(大概 49B)。如果激活量要提升三倍的话,意味着模型整体规模可能会在 3 万亿到 4 万亿参数之间,这对算力的要求非常高。
当下中国最大的模型是 Kimi K3,参数大概在 2.7 万亿左右(在 2 万亿到 3 万亿之间),这还是要比美国模型小一半。美国的主流模型,无论是 xAI、Anthropic 还是 OpenAI,大概都在 5 万亿参数之上或附近,它们激活的参数同时都是几百 B。
要在今年年底去训练激活量为 150B 参数的新一代 DeepSeek 模型,目前我们知道的是,在美方禁令生效之前,DeepSeek 囤积了大概相当于 2 万张英伟达 A100 或 A800 芯片的集群算力。后来它有没有通过其他灰色渠道购买到新芯片,我们不得而知;仅从官方公布的数据来看,这些芯片是不足以同时支撑超大规模模型的训练和推理的。

不过今年华为确实开始加速向 DeepSeek 供货(即 950PR 推理芯片)。根据梁文锋自己的说法,华为大概给了他 16,000 张左右的芯片配额,这大概只相当于四五千张英伟达芯片,对于总体算力的缓解其实完全不够。但是 DeepSeek 也很想配合华为把生态做好,所以也在积极配合。如果今年能够加大供应,供应越多的华为 950PR,DeepSeek 就能够把更多的英伟达芯片解放出来,组建集群去训练下一代的 DeepSeek V5。
华为在今年四季度的年底,会向用户小批量交付 950DT 训练芯片。如果要上量的话,我估计要到明年之后了,这肯定是远水解不了近渴,DeepSeek 不可能等到华为 950DT 大批量交付之后才开始 V5 的训练。所以 DeepSeek 下一代主力模型的训练依然会基于英伟达架构,950DT 即便交付了,可能也只是承担一些辅助训练任务。
目前完全基于华为昇腾 910B/910C 国产生态训练的模型,有万亿参数的美团 LongCat 以及 7,440 亿参数的 GLM 5.2。虽然它们的跑分和评价都还不错,但毕竟参数总量还是比美国的模型小得多。
那么,是不是我们当下国产 AI 生态就会被英伟达给锁死呢?其实完全不是这样。就在那个会议录音的 PDF 文件里,梁文锋其实给出了完全相反的看法。梁文锋并不认为英伟达具备什么高深的护城河,其 CUDA 也不是什么不可超越的神话。事实上,DeepSeek 在早期曾经手写过 PTX(英伟达的汇编指令)去优化 CUDA 算子,但在 V3 和 V4 版本中,他们已经是使用国产的 TileLang 高级语言去写中间件了。也就是说,他们是用 TileLang 写的中间件去对接 PyTorch 以及底层的 ROCm、CUDA 或华为的 CANN 架构。目前这个工作根据梁文锋自己的说法已经是完成了大部分,可能还有一小部分没有完成,但可以确定 DeepSeek 是能够完全完成的。

也就是说,即便是下一代的主力模型依然使用英伟达的旧卡生态来训练,也不妨碍等华为芯片的供应量充足之后,平滑地迁移到华为的训练集群上来。当然,中间难免有一些阵痛,就像这一次推理转换到华为 950PR 芯片带来的阵痛一样。有阵痛就会有收获,现在 DeepSeek 能够以这么低的价格承担这么庞大的用量请求,华为昇腾芯片可以说也交出了满意的答卷。
目前,中国的 DUV 已经完成了技术攻关,无论是干式还是浸润式的都投入了量产。EUV 光刻机之前传出造出了工程样机但没有流片成功,这是很早之前的传闻了,到现在我个人认为应当是流片成功并打通了整个流程,但是距离量产还是有比较远的距离。具体突破到什么程度,我们除了关注一些小道消息和花边新闻,还是要等待权威消息公布。
有的观众在视频下方留言说:如果华为能够通过落后制程的芯片,通过堆更大规模的集群来产生更大的算力,那么英伟达为什么不能这样做呢?他还特别提到英伟达的 NVLink 在今年四季度又要发布新产品,整个机柜的性能又有大大提升。
但是我想说,NVLink 本质上依然是电互联技术,传输的还是电信号,走的是铜缆。这一块无论怎么折腾、怎么提升效率,也只能提升一个小小的机柜。如果扩展到万卡集群,最终还是要走光互联方案。而在光互联这一块,华为的技术积累要远远强于英伟达。华为是做通信技术起家的,是世界上排名第一、远超第二名的通信企业,当年是从激烈的红海竞争中一路尸山血海杀过来的,先后击败了爱立信、诺基亚、摩托罗拉、思科等通信巨头。

华为走到今天这一步,付出了很大的代价,花了很长的时间。如果说中国突破西方的技术限制需要很长时间,那么西方想要在光互联技术上去赶上中国企业,其实也是比较困难的。目前世界排名靠前的几个光模块企业其实都是中国的。西方的 1.6T 光模块产品还在实验室阶段,还没有完全走入量产;而中国的 1.6T 光模块早就量产了,甚至 2.4T、3.2T 的产品已经研发完毕并送样华为,马上就要投入量产。这一块的差距是非常明显的。面对困难我们要实事求是,但我们也不至于妄自菲薄,有优势的地方还是要保持战略自信。
最后,我非常想开一个直播系列。因为我这个人是个嘴炮,就喜欢跟别人抬杠,但像现在这样对着镜头一个人讲实在不过瘾。你们在评论区打字,我在镜头前瞎聊,不够给劲。我在考虑要不要找一个语音软件,然后在论坛发个帖子让大家报名,到时候大家聚在一起聊聊天、切磋一下。或许在现场的一问一答中,更能表达清楚自己的想法。
先看着办吧,我得先锻炼一下自己面对镜头的能力。像老梁、王局他们,对着镜头娓娓道来,整个视频可能一刀未剪;而我做完一个视频,怎么也得剪个几十刀。先把这个能力锻炼上来吧。
在上期的视频评论区,有网友留言说他比较认同我关于中美两国 AI 大模型竞争态势的判断,即中国的大模型可能会以极低的价格和极致的性价比在竞争中占据优势地位;但他不太认同我关于两国硬件竞争的预判。他认为英伟达的 CUDA 生态护城河依然非常深,专利壁垒极强,中国企业尤其是华为想要突破是比较困难的。那么本期视频,我们就继续讨论一下这个话题。

前几天,DeepSeek V4 Flash 正式版发布之后掀起了一股狂热的旋风,似乎整个网络都在使用。在 8 月 1 日,OpenCode 这款 AI 编程工具仅在单个平台就消耗了 8 万亿 tokens,这是一个非常恐怖的量。其中有 5 万亿是优惠引流,另外 3 万亿是用户自费购买。这是一个什么样的概念呢?全球最大的 AI 聚合平台 OpenRouter.ai 上面几百个模型,单日的 tokens 总消耗量大概是 6.6 万亿。也就是说,OpenCode 这一个软件就超过了它整个平台的调用量。而且即便是在 OpenRouter.ai 上,排名第一的也是 DeepSeek V4 Flash,DeepSeek V4 Pro 也进入了前几名。再加上 DeepSeek 官方 API 的调用,以及庞大的第三方 DeepSeek 部署,可以说 DeepSeek 毫无疑问就是当下 AI 开源领域的王者。

这位网友还提到了 DeepSeek 与投资人会议的录音,现在在网上被人转化成了 PDF 文件。我本来是不太相信这些边角料新闻的,因为这个 PDF 我早就看过。但是我今天搜索了一下网络,发现这个 PDF 在国内已经搜不到了,并且在豆包上也已经没有人谈论这个话题,如果你问它,它也会拒绝回答。这让我更加相信这件事可能是真的。
我又去认真看了一下那个文件。梁文锋认为,当下 DeepSeek 跟美国 AI 顶尖梯队的差距大概在一到两年的时间,他的目标是将差距缩小到半年甚至三个月,但要以 1/20 的成本去做到这一切。不过从 DeepSeek V4 Flash 正式版发布后的表现来看,梁文锋已经提前做到了,当下两者的差距大概就在半年左右。中国的一些顶级模型,比如 Kimi K3,它的跑分已经是跟 Claude Fabo5 达到了同一个档次,差距可能已经小于三个月了。
但是这只是当下,虽然我们看到中国的 AI 大模型非常红火,不仅在文本和通用大模型方面,在多模态领域,字节跳动的 Seedance 2.5 以及 MiniMax 最新开源的 H3,都掀起了互联网的讨论狂潮,可以说是好评如潮。

但事实上,中国的大模型确实是有危机的。就像梁文锋自己说的,他打算在今年年底去训练新一代的大模型(可能是 DeepSeek V5),目标是激活 150B 参数。那么当下的 DeepSeek V4 Pro 是一个什么样的水平呢?它是 1.4 万亿参数,但激活量只有 50B(大概 49B)。如果激活量要提升三倍的话,意味着模型整体规模可能会在 3 万亿到 4 万亿参数之间,这对算力的要求非常高。
当下中国最大的模型是 Kimi K3,参数大概在 2.7 万亿左右(在 2 万亿到 3 万亿之间),这还是要比美国模型小一半。美国的主流模型,无论是 xAI、Anthropic 还是 OpenAI,大概都在 5 万亿参数之上或附近,它们激活的参数同时都是几百 B。
要在今年年底去训练激活量为 150B 参数的新一代 DeepSeek 模型,目前我们知道的是,在美方禁令生效之前,DeepSeek 囤积了大概相当于 2 万张英伟达 A100 或 A800 芯片的集群算力。后来它有没有通过其他灰色渠道购买到新芯片,我们不得而知;仅从官方公布的数据来看,这些芯片是不足以同时支撑超大规模模型的训练和推理的。

不过今年华为确实开始加速向 DeepSeek 供货(即 950PR 推理芯片)。根据梁文锋自己的说法,华为大概给了他 16,000 张左右的芯片配额,这大概只相当于四五千张英伟达芯片,对于总体算力的缓解其实完全不够。但是 DeepSeek 也很想配合华为把生态做好,所以也在积极配合。如果今年能够加大供应,供应越多的华为 950PR,DeepSeek 就能够把更多的英伟达芯片解放出来,组建集群去训练下一代的 DeepSeek V5。
华为在今年四季度的年底,会向用户小批量交付 950DT 训练芯片。如果要上量的话,我估计要到明年之后了,这肯定是远水解不了近渴,DeepSeek 不可能等到华为 950DT 大批量交付之后才开始 V5 的训练。所以 DeepSeek 下一代主力模型的训练依然会基于英伟达架构,950DT 即便交付了,可能也只是承担一些辅助训练任务。
目前完全基于华为昇腾 910B/910C 国产生态训练的模型,有万亿参数的美团 LongCat 以及 7,440 亿参数的 GLM 5.2。虽然它们的跑分和评价都还不错,但毕竟参数总量还是比美国的模型小得多。
那么,是不是我们当下国产 AI 生态就会被英伟达给锁死呢?其实完全不是这样。就在那个会议录音的 PDF 文件里,梁文锋其实给出了完全相反的看法。梁文锋并不认为英伟达具备什么高深的护城河,其 CUDA 也不是什么不可超越的神话。事实上,DeepSeek 在早期曾经手写过 PTX(英伟达的汇编指令)去优化 CUDA 算子,但在 V3 和 V4 版本中,他们已经是使用国产的 TileLang 高级语言去写中间件了。也就是说,他们是用 TileLang 写的中间件去对接 PyTorch 以及底层的 ROCm、CUDA 或华为的 CANN 架构。目前这个工作根据梁文锋自己的说法已经是完成了大部分,可能还有一小部分没有完成,但可以确定 DeepSeek 是能够完全完成的。

也就是说,即便是下一代的主力模型依然使用英伟达的旧卡生态来训练,也不妨碍等华为芯片的供应量充足之后,平滑地迁移到华为的训练集群上来。当然,中间难免有一些阵痛,就像这一次推理转换到华为 950PR 芯片带来的阵痛一样。有阵痛就会有收获,现在 DeepSeek 能够以这么低的价格承担这么庞大的用量请求,华为昇腾芯片可以说也交出了满意的答卷。
目前,中国的 DUV 已经完成了技术攻关,无论是干式还是浸润式的都投入了量产。EUV 光刻机之前传出造出了工程样机但没有流片成功,这是很早之前的传闻了,到现在我个人认为应当是流片成功并打通了整个流程,但是距离量产还是有比较远的距离。具体突破到什么程度,我们除了关注一些小道消息和花边新闻,还是要等待权威消息公布。
有的观众在视频下方留言说:如果华为能够通过落后制程的芯片,通过堆更大规模的集群来产生更大的算力,那么英伟达为什么不能这样做呢?他还特别提到英伟达的 NVLink 在今年四季度又要发布新产品,整个机柜的性能又有大大提升。
但是我想说,NVLink 本质上依然是电互联技术,传输的还是电信号,走的是铜缆。这一块无论怎么折腾、怎么提升效率,也只能提升一个小小的机柜。如果扩展到万卡集群,最终还是要走光互联方案。而在光互联这一块,华为的技术积累要远远强于英伟达。华为是做通信技术起家的,是世界上排名第一、远超第二名的通信企业,当年是从激烈的红海竞争中一路尸山血海杀过来的,先后击败了爱立信、诺基亚、摩托罗拉、思科等通信巨头。

华为走到今天这一步,付出了很大的代价,花了很长的时间。如果说中国突破西方的技术限制需要很长时间,那么西方想要在光互联技术上去赶上中国企业,其实也是比较困难的。目前世界排名靠前的几个光模块企业其实都是中国的。西方的 1.6T 光模块产品还在实验室阶段,还没有完全走入量产;而中国的 1.6T 光模块早就量产了,甚至 2.4T、3.2T 的产品已经研发完毕并送样华为,马上就要投入量产。这一块的差距是非常明显的。面对困难我们要实事求是,但我们也不至于妄自菲薄,有优势的地方还是要保持战略自信。
最后,我非常想开一个直播系列。因为我这个人是个嘴炮,就喜欢跟别人抬杠,但像现在这样对着镜头一个人讲实在不过瘾。你们在评论区打字,我在镜头前瞎聊,不够给劲。我在考虑要不要找一个语音软件,然后在论坛发个帖子让大家报名,到时候大家聚在一起聊聊天、切磋一下。或许在现场的一问一答中,更能表达清楚自己的想法。
先看着办吧,我得先锻炼一下自己面对镜头的能力。像老梁、王局他们,对着镜头娓娓道来,整个视频可能一刀未剪;而我做完一个视频,怎么也得剪个几十刀。先把这个能力锻炼上来吧。
