跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
折叠
品牌标识

抡锤者

  1. 主页
  2. 版块
  3. 随便聊聊
  4. DeepSeek V4 Flash爆火,调用量破纪录,但是梁文锋谈话泄露华为芯片短期内供货不足,V5训练还得仰仗英伟达算力集群,会被CUDA生态锁死吗?

DeepSeek V4 Flash爆火,调用量破纪录,但是梁文锋谈话泄露华为芯片短期内供货不足,V5训练还得仰仗英伟达算力集群,会被CUDA生态锁死吗?

已定时 已固定 已锁定 已移动 随便聊聊
huaweideepseeknvidia
10 帖子 6 发布者 290 浏览 1 关注中
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • terryT 在线
    terryT 在线
    terry
    超级版主
    编写于 最后由 编辑
    #1

    在上期的视频评论区,有网友留言说他比较认同我关于中美两国 AI 大模型竞争态势的判断,即中国的大模型可能会以极低的价格和极致的性价比在竞争中占据优势地位;但他不太认同我关于两国硬件竞争的预判。他认为英伟达的 CUDA 生态护城河依然非常深,专利壁垒极强,中国企业尤其是华为想要突破是比较困难的。那么本期视频,我们就继续讨论一下这个话题。

    Openrouter排名8-5.png

    前几天,DeepSeek V4 Flash 正式版发布之后掀起了一股狂热的旋风,似乎整个网络都在使用。在 8 月 1 日,OpenCode 这款 AI 编程工具仅在单个平台就消耗了 8 万亿 tokens,这是一个非常恐怖的量。其中有 5 万亿是优惠引流,另外 3 万亿是用户自费购买。这是一个什么样的概念呢?全球最大的 AI 聚合平台 OpenRouter.ai 上面几百个模型,单日的 tokens 总消耗量大概是 6.6 万亿。也就是说,OpenCode 这一个软件就超过了它整个平台的调用量。而且即便是在 OpenRouter.ai 上,排名第一的也是 DeepSeek V4 Flash,DeepSeek V4 Pro 也进入了前几名。再加上 DeepSeek 官方 API 的调用,以及庞大的第三方 DeepSeek 部署,可以说 DeepSeek 毫无疑问就是当下 AI 开源领域的王者。

    DeepSeek算力危机.jpg

    这位网友还提到了 DeepSeek 与投资人会议的录音,现在在网上被人转化成了 PDF 文件。我本来是不太相信这些边角料新闻的,因为这个 PDF 我早就看过。但是我今天搜索了一下网络,发现这个 PDF 在国内已经搜不到了,并且在豆包上也已经没有人谈论这个话题,如果你问它,它也会拒绝回答。这让我更加相信这件事可能是真的。

    我又去认真看了一下那个文件。梁文锋认为,当下 DeepSeek 跟美国 AI 顶尖梯队的差距大概在一到两年的时间,他的目标是将差距缩小到半年甚至三个月,但要以 1/20 的成本去做到这一切。不过从 DeepSeek V4 Flash 正式版发布后的表现来看,梁文锋已经提前做到了,当下两者的差距大概就在半年左右。中国的一些顶级模型,比如 Kimi K3,它的跑分已经是跟 Claude Fabo5 达到了同一个档次,差距可能已经小于三个月了。

    但是这只是当下,虽然我们看到中国的 AI 大模型非常红火,不仅在文本和通用大模型方面,在多模态领域,字节跳动的 Seedance 2.5 以及 MiniMax 最新开源的 H3,都掀起了互联网的讨论狂潮,可以说是好评如潮。

    Minimax H3.avif

    但事实上,中国的大模型确实是有危机的。就像梁文锋自己说的,他打算在今年年底去训练新一代的大模型(可能是 DeepSeek V5),目标是激活 150B 参数。那么当下的 DeepSeek V4 Pro 是一个什么样的水平呢?它是 1.4 万亿参数,但激活量只有 50B(大概 49B)。如果激活量要提升三倍的话,意味着模型整体规模可能会在 3 万亿到 4 万亿参数之间,这对算力的要求非常高。

    当下中国最大的模型是 Kimi K3,参数大概在 2.7 万亿左右(在 2 万亿到 3 万亿之间),这还是要比美国模型小一半。美国的主流模型,无论是 xAI、Anthropic 还是 OpenAI,大概都在 5 万亿参数之上或附近,它们激活的参数同时都是几百 B。

    要在今年年底去训练激活量为 150B 参数的新一代 DeepSeek 模型,目前我们知道的是,在美方禁令生效之前,DeepSeek 囤积了大概相当于 2 万张英伟达 A100 或 A800 芯片的集群算力。后来它有没有通过其他灰色渠道购买到新芯片,我们不得而知;仅从官方公布的数据来看,这些芯片是不足以同时支撑超大规模模型的训练和推理的。

    AI计算集群.jpeg

    不过今年华为确实开始加速向 DeepSeek 供货(即 950PR 推理芯片)。根据梁文锋自己的说法,华为大概给了他 16,000 张左右的芯片配额,这大概只相当于四五千张英伟达芯片,对于总体算力的缓解其实完全不够。但是 DeepSeek 也很想配合华为把生态做好,所以也在积极配合。如果今年能够加大供应,供应越多的华为 950PR,DeepSeek 就能够把更多的英伟达芯片解放出来,组建集群去训练下一代的 DeepSeek V5。

    华为在今年四季度的年底,会向用户小批量交付 950DT 训练芯片。如果要上量的话,我估计要到明年之后了,这肯定是远水解不了近渴,DeepSeek 不可能等到华为 950DT 大批量交付之后才开始 V5 的训练。所以 DeepSeek 下一代主力模型的训练依然会基于英伟达架构,950DT 即便交付了,可能也只是承担一些辅助训练任务。

    目前完全基于华为昇腾 910B/910C 国产生态训练的模型,有万亿参数的美团 LongCat 以及 7,440 亿参数的 GLM 5.2。虽然它们的跑分和评价都还不错,但毕竟参数总量还是比美国的模型小得多。

    那么,是不是我们当下国产 AI 生态就会被英伟达给锁死呢?其实完全不是这样。就在那个会议录音的 PDF 文件里,梁文锋其实给出了完全相反的看法。梁文锋并不认为英伟达具备什么高深的护城河,其 CUDA 也不是什么不可超越的神话。事实上,DeepSeek 在早期曾经手写过 PTX(英伟达的汇编指令)去优化 CUDA 算子,但在 V3 和 V4 版本中,他们已经是使用国产的 TileLang 高级语言去写中间件了。也就是说,他们是用 TileLang 写的中间件去对接 PyTorch 以及底层的 ROCm、CUDA 或华为的 CANN 架构。目前这个工作根据梁文锋自己的说法已经是完成了大部分,可能还有一小部分没有完成,但可以确定 DeepSeek 是能够完全完成的。

    华为测试deepseek.jpg

    也就是说,即便是下一代的主力模型依然使用英伟达的旧卡生态来训练,也不妨碍等华为芯片的供应量充足之后,平滑地迁移到华为的训练集群上来。当然,中间难免有一些阵痛,就像这一次推理转换到华为 950PR 芯片带来的阵痛一样。有阵痛就会有收获,现在 DeepSeek 能够以这么低的价格承担这么庞大的用量请求,华为昇腾芯片可以说也交出了满意的答卷。

    目前,中国的 DUV 已经完成了技术攻关,无论是干式还是浸润式的都投入了量产。EUV 光刻机之前传出造出了工程样机但没有流片成功,这是很早之前的传闻了,到现在我个人认为应当是流片成功并打通了整个流程,但是距离量产还是有比较远的距离。具体突破到什么程度,我们除了关注一些小道消息和花边新闻,还是要等待权威消息公布。

    有的观众在视频下方留言说:如果华为能够通过落后制程的芯片,通过堆更大规模的集群来产生更大的算力,那么英伟达为什么不能这样做呢?他还特别提到英伟达的 NVLink 在今年四季度又要发布新产品,整个机柜的性能又有大大提升。

    但是我想说,NVLink 本质上依然是电互联技术,传输的还是电信号,走的是铜缆。这一块无论怎么折腾、怎么提升效率,也只能提升一个小小的机柜。如果扩展到万卡集群,最终还是要走光互联方案。而在光互联这一块,华为的技术积累要远远强于英伟达。华为是做通信技术起家的,是世界上排名第一、远超第二名的通信企业,当年是从激烈的红海竞争中一路尸山血海杀过来的,先后击败了爱立信、诺基亚、摩托罗拉、思科等通信巨头。

    33ed6631-d7bf-4431-8b7b-90315ca57fab-image.jpeg

    华为走到今天这一步,付出了很大的代价,花了很长的时间。如果说中国突破西方的技术限制需要很长时间,那么西方想要在光互联技术上去赶上中国企业,其实也是比较困难的。目前世界排名靠前的几个光模块企业其实都是中国的。西方的 1.6T 光模块产品还在实验室阶段,还没有完全走入量产;而中国的 1.6T 光模块早就量产了,甚至 2.4T、3.2T 的产品已经研发完毕并送样华为,马上就要投入量产。这一块的差距是非常明显的。面对困难我们要实事求是,但我们也不至于妄自菲薄,有优势的地方还是要保持战略自信。

    最后,我非常想开一个直播系列。因为我这个人是个嘴炮,就喜欢跟别人抬杠,但像现在这样对着镜头一个人讲实在不过瘾。你们在评论区打字,我在镜头前瞎聊,不够给劲。我在考虑要不要找一个语音软件,然后在论坛发个帖子让大家报名,到时候大家聚在一起聊聊天、切磋一下。或许在现场的一问一答中,更能表达清楚自己的想法。

    先看着办吧,我得先锻炼一下自己面对镜头的能力。像老梁、王局他们,对着镜头娓娓道来,整个视频可能一刀未剪;而我做完一个视频,怎么也得剪个几十刀。先把这个能力锻炼上来吧。

    在上期的视频评论区,有网友留言说他比较认同我关于中美两国 AI 大模型竞争态势的判断,即中国的大模型可能会以极低的价格和极致的性价比在竞争中占据优势地位;但他不太认同我关于两国硬件竞争的预判。他认为英伟达的 CUDA 生态护城河依然非常深,专利壁垒极强,中国企业尤其是华为想要突破是比较困难的。那么本期视频,我们就继续讨论一下这个话题。

    Openrouter排名8-5.png

    前几天,DeepSeek V4 Flash 正式版发布之后掀起了一股狂热的旋风,似乎整个网络都在使用。在 8 月 1 日,OpenCode 这款 AI 编程工具仅在单个平台就消耗了 8 万亿 tokens,这是一个非常恐怖的量。其中有 5 万亿是优惠引流,另外 3 万亿是用户自费购买。这是一个什么样的概念呢?全球最大的 AI 聚合平台 OpenRouter.ai 上面几百个模型,单日的 tokens 总消耗量大概是 6.6 万亿。也就是说,OpenCode 这一个软件就超过了它整个平台的调用量。而且即便是在 OpenRouter.ai 上,排名第一的也是 DeepSeek V4 Flash,DeepSeek V4 Pro 也进入了前几名。再加上 DeepSeek 官方 API 的调用,以及庞大的第三方 DeepSeek 部署,可以说 DeepSeek 毫无疑问就是当下 AI 开源领域的王者。

    DeepSeek算力危机.jpg

    这位网友还提到了 DeepSeek 与投资人会议的录音,现在在网上被人转化成了 PDF 文件。我本来是不太相信这些边角料新闻的,因为这个 PDF 我早就看过。但是我今天搜索了一下网络,发现这个 PDF 在国内已经搜不到了,并且在豆包上也已经没有人谈论这个话题,如果你问它,它也会拒绝回答。这让我更加相信这件事可能是真的。

    我又去认真看了一下那个文件。梁文锋认为,当下 DeepSeek 跟美国 AI 顶尖梯队的差距大概在一到两年的时间,他的目标是将差距缩小到半年甚至三个月,但要以 1/20 的成本去做到这一切。不过从 DeepSeek V4 Flash 正式版发布后的表现来看,梁文锋已经提前做到了,当下两者的差距大概就在半年左右。中国的一些顶级模型,比如 Kimi K3,它的跑分已经是跟 Claude Fabo5 达到了同一个档次,差距可能已经小于三个月了。

    但是这只是当下,虽然我们看到中国的 AI 大模型非常红火,不仅在文本和通用大模型方面,在多模态领域,字节跳动的 Seedance 2.5 以及 MiniMax 最新开源的 H3,都掀起了互联网的讨论狂潮,可以说是好评如潮。

    Minimax H3.avif

    但事实上,中国的大模型确实是有危机的。就像梁文锋自己说的,他打算在今年年底去训练新一代的大模型(可能是 DeepSeek V5),目标是激活 150B 参数。那么当下的 DeepSeek V4 Pro 是一个什么样的水平呢?它是 1.4 万亿参数,但激活量只有 50B(大概 49B)。如果激活量要提升三倍的话,意味着模型整体规模可能会在 3 万亿到 4 万亿参数之间,这对算力的要求非常高。

    当下中国最大的模型是 Kimi K3,参数大概在 2.7 万亿左右(在 2 万亿到 3 万亿之间),这还是要比美国模型小一半。美国的主流模型,无论是 xAI、Anthropic 还是 OpenAI,大概都在 5 万亿参数之上或附近,它们激活的参数同时都是几百 B。

    要在今年年底去训练激活量为 150B 参数的新一代 DeepSeek 模型,目前我们知道的是,在美方禁令生效之前,DeepSeek 囤积了大概相当于 2 万张英伟达 A100 或 A800 芯片的集群算力。后来它有没有通过其他灰色渠道购买到新芯片,我们不得而知;仅从官方公布的数据来看,这些芯片是不足以同时支撑超大规模模型的训练和推理的。

    AI计算集群.jpeg

    不过今年华为确实开始加速向 DeepSeek 供货(即 950PR 推理芯片)。根据梁文锋自己的说法,华为大概给了他 16,000 张左右的芯片配额,这大概只相当于四五千张英伟达芯片,对于总体算力的缓解其实完全不够。但是 DeepSeek 也很想配合华为把生态做好,所以也在积极配合。如果今年能够加大供应,供应越多的华为 950PR,DeepSeek 就能够把更多的英伟达芯片解放出来,组建集群去训练下一代的 DeepSeek V5。

    华为在今年四季度的年底,会向用户小批量交付 950DT 训练芯片。如果要上量的话,我估计要到明年之后了,这肯定是远水解不了近渴,DeepSeek 不可能等到华为 950DT 大批量交付之后才开始 V5 的训练。所以 DeepSeek 下一代主力模型的训练依然会基于英伟达架构,950DT 即便交付了,可能也只是承担一些辅助训练任务。

    目前完全基于华为昇腾 910B/910C 国产生态训练的模型,有万亿参数的美团 LongCat 以及 7,440 亿参数的 GLM 5.2。虽然它们的跑分和评价都还不错,但毕竟参数总量还是比美国的模型小得多。

    那么,是不是我们当下国产 AI 生态就会被英伟达给锁死呢?其实完全不是这样。就在那个会议录音的 PDF 文件里,梁文锋其实给出了完全相反的看法。梁文锋并不认为英伟达具备什么高深的护城河,其 CUDA 也不是什么不可超越的神话。事实上,DeepSeek 在早期曾经手写过 PTX(英伟达的汇编指令)去优化 CUDA 算子,但在 V3 和 V4 版本中,他们已经是使用国产的 TileLang 高级语言去写中间件了。也就是说,他们是用 TileLang 写的中间件去对接 PyTorch 以及底层的 ROCm、CUDA 或华为的 CANN 架构。目前这个工作根据梁文锋自己的说法已经是完成了大部分,可能还有一小部分没有完成,但可以确定 DeepSeek 是能够完全完成的。

    华为测试deepseek.jpg

    也就是说,即便是下一代的主力模型依然使用英伟达的旧卡生态来训练,也不妨碍等华为芯片的供应量充足之后,平滑地迁移到华为的训练集群上来。当然,中间难免有一些阵痛,就像这一次推理转换到华为 950PR 芯片带来的阵痛一样。有阵痛就会有收获,现在 DeepSeek 能够以这么低的价格承担这么庞大的用量请求,华为昇腾芯片可以说也交出了满意的答卷。

    目前,中国的 DUV 已经完成了技术攻关,无论是干式还是浸润式的都投入了量产。EUV 光刻机之前传出造出了工程样机但没有流片成功,这是很早之前的传闻了,到现在我个人认为应当是流片成功并打通了整个流程,但是距离量产还是有比较远的距离。具体突破到什么程度,我们除了关注一些小道消息和花边新闻,还是要等待权威消息公布。

    有的观众在视频下方留言说:如果华为能够通过落后制程的芯片,通过堆更大规模的集群来产生更大的算力,那么英伟达为什么不能这样做呢?他还特别提到英伟达的 NVLink 在今年四季度又要发布新产品,整个机柜的性能又有大大提升。

    但是我想说,NVLink 本质上依然是电互联技术,传输的还是电信号,走的是铜缆。这一块无论怎么折腾、怎么提升效率,也只能提升一个小小的机柜。如果扩展到万卡集群,最终还是要走光互联方案。而在光互联这一块,华为的技术积累要远远强于英伟达。华为是做通信技术起家的,是世界上排名第一、远超第二名的通信企业,当年是从激烈的红海竞争中一路尸山血海杀过来的,先后击败了爱立信、诺基亚、摩托罗拉、思科等通信巨头。

    33ed6631-d7bf-4431-8b7b-90315ca57fab-image.jpeg

    华为走到今天这一步,付出了很大的代价,花了很长的时间。如果说中国突破西方的技术限制需要很长时间,那么西方想要在光互联技术上去赶上中国企业,其实也是比较困难的。目前世界排名靠前的几个光模块企业其实都是中国的。西方的 1.6T 光模块产品还在实验室阶段,还没有完全走入量产;而中国的 1.6T 光模块早就量产了,甚至 2.4T、3.2T 的产品已经研发完毕并送样华为,马上就要投入量产。这一块的差距是非常明显的。面对困难我们要实事求是,但我们也不至于妄自菲薄,有优势的地方还是要保持战略自信。

    最后,我非常想开一个直播系列。因为我这个人是个嘴炮,就喜欢跟别人抬杠,但像现在这样对着镜头一个人讲实在不过瘾。你们在评论区打字,我在镜头前瞎聊,不够给劲。我在考虑要不要找一个语音软件,然后在论坛发个帖子让大家报名,到时候大家聚在一起聊聊天、切磋一下。或许在现场的一问一答中,更能表达清楚自己的想法。

    先看着办吧,我得先锻炼一下自己面对镜头的能力。像老梁、王局他们,对着镜头娓娓道来,整个视频可能一刀未剪;而我做完一个视频,怎么也得剪个几十刀。先把这个能力锻炼上来吧。

    油管:https://www.youtube.com/@抡锤者

    seewoscottS 1 条回复 最后回复
    2
    • terryT 在线
      terryT 在线
      terry
      超级版主
      编写于 最后由 编辑
      #2

      Youtube Video

      油管:https://www.youtube.com/@抡锤者

      1 条回复 最后回复
      2
      • lukun geL 离线
        lukun geL 离线
        lukun ge
        编写于 最后由 编辑
        #3

        在deepseek R1出现的时候,资本市场就对这场竞争给了结论性的回应,大模型的护城河并不高,美国的公司无法一枝独秀。当然这个护城河“不高”是有前提的,就是玩家得能够入围所谓的“斩杀线”,人才,电力,芯片都得具备,才有当玩家的资格。
        国内的模型能力能跟住第一梯队,离不开自己的电力和人才储备,还有一个重要因素来自对美国模型的蒸馏。所有模型的训练,都需要有高质量的数据,数据清洗的过程普遍依赖人工标注的,特别是科学类的论文,而蒸馏是获得高质量标注数据的捷径。换句话讲,国内模型的进步很大程度上被美国模型拉着进步的。
        未来芯片问题终究会被解决,决定竞争胜负终究会是性价比,openai和anthropic都不是未来国内玩家的主要对手,毕竟在一个维度上竞争,全世界都不是国货的对手,这个在电动车领域已经体现的淋漓精致了。国内公司真正的对手来自spaceX,太空算力中心30万亿美金的故事才是最大的威胁,老马的愿望万一实现了,才是真正的“维度”竞争,这个方案的核心是占据特定的卫星轨道资源,这种特殊的轨道资源是有限的,先到先得,目前spaceX的单公斤发射成本还是国内的20分之一左右,有望拉到百分之一的差距数量级,这种差距不是2年能赶上来的,因此spaceX才是未来国内公司最大的竞争对手。

        terryT 1 条回复 最后回复
        1
        • lukun geL lukun ge

          在deepseek R1出现的时候,资本市场就对这场竞争给了结论性的回应,大模型的护城河并不高,美国的公司无法一枝独秀。当然这个护城河“不高”是有前提的,就是玩家得能够入围所谓的“斩杀线”,人才,电力,芯片都得具备,才有当玩家的资格。
          国内的模型能力能跟住第一梯队,离不开自己的电力和人才储备,还有一个重要因素来自对美国模型的蒸馏。所有模型的训练,都需要有高质量的数据,数据清洗的过程普遍依赖人工标注的,特别是科学类的论文,而蒸馏是获得高质量标注数据的捷径。换句话讲,国内模型的进步很大程度上被美国模型拉着进步的。
          未来芯片问题终究会被解决,决定竞争胜负终究会是性价比,openai和anthropic都不是未来国内玩家的主要对手,毕竟在一个维度上竞争,全世界都不是国货的对手,这个在电动车领域已经体现的淋漓精致了。国内公司真正的对手来自spaceX,太空算力中心30万亿美金的故事才是最大的威胁,老马的愿望万一实现了,才是真正的“维度”竞争,这个方案的核心是占据特定的卫星轨道资源,这种特殊的轨道资源是有限的,先到先得,目前spaceX的单公斤发射成本还是国内的20分之一左右,有望拉到百分之一的差距数量级,这种差距不是2年能赶上来的,因此spaceX才是未来国内公司最大的竞争对手。

          terryT 在线
          terryT 在线
          terry
          超级版主
          编写于 最后由 编辑
          #4

          @lukun-ge Space X也不是问题,现在领先较多,但并非不可追赶,甚至都不能算不好追赶,主要是要认识到差距。马国公一个人占不了那么多轨道,不过确实窗口期不长了,要加油。目前商业发射进展不错,国家队也有布局。

          马国公最大的问题是他的帝国只有很小一部分是真材实料,水分太大,完全去中华产业链意味着高成本,这和它的根本目标是矛盾的。他已经在选择保政治正确和政府订单,走这一步路,已经下策了。

          油管:https://www.youtube.com/@抡锤者

          1 条回复 最后回复
          0
          • Fery ChenF 离线
            Fery ChenF 离线
            Fery Chen
            德高望重
            编写于 最后由 编辑
            #5

            @terry Deepseek算力紧张,今日预告要涨价了。不知道多少而已……

            terryT 1 条回复 最后回复
            1
            • Fery ChenF Fery Chen

              @terry Deepseek算力紧张,今日预告要涨价了。不知道多少而已……

              terryT 在线
              terryT 在线
              terry
              超级版主
              编写于 最后由 编辑
              #6

              @Fery-Chen 涨吧,现在确实便宜了,涨了其他模型性价比就有了,不着急,干嘛绑定它呢,咱屌丝就是谁性价比高就用谁。说实话它的1M上下文优势很大,但是干脏活可以用Qwen 27b,或者用在线的HY3替代,只要不比雷布斯的小米模型贵,我觉得也没啥问题,我还是会用。

              油管:https://www.youtube.com/@抡锤者

              1 条回复 最后回复
              2
              • Tony WangT 在线
                Tony WangT 在线
                Tony Wang
                超级版主
                编写于 最后由 编辑
                #7

                @terry

                如果要锻炼演讲能力, 建议可以列出提纲, 以及一些亮点, 比如你擅长的 古文, 古诗句引用等.

                但不要写出全部文字稿, 对着提纲和两点, 在心里串场一两遍, 就差不多了.

                支持直播.

                terryT 1 条回复 最后回复
                1
                • Tony WangT Tony Wang

                  @terry

                  如果要锻炼演讲能力, 建议可以列出提纲, 以及一些亮点, 比如你擅长的 古文, 古诗句引用等.

                  但不要写出全部文字稿, 对着提纲和两点, 在心里串场一两遍, 就差不多了.

                  支持直播.

                  terryT 在线
                  terryT 在线
                  terry
                  超级版主
                  编写于 最后由 编辑
                  #8

                  @Tony-Wang 不需要,以前直接脱稿演讲的,只是宅多了,大脑习惯了打字表达。唤醒记忆即可。

                  油管:https://www.youtube.com/@抡锤者

                  1 条回复 最后回复
                  2
                  • terryT terry

                    在上期的视频评论区,有网友留言说他比较认同我关于中美两国 AI 大模型竞争态势的判断,即中国的大模型可能会以极低的价格和极致的性价比在竞争中占据优势地位;但他不太认同我关于两国硬件竞争的预判。他认为英伟达的 CUDA 生态护城河依然非常深,专利壁垒极强,中国企业尤其是华为想要突破是比较困难的。那么本期视频,我们就继续讨论一下这个话题。

                    Openrouter排名8-5.png

                    前几天,DeepSeek V4 Flash 正式版发布之后掀起了一股狂热的旋风,似乎整个网络都在使用。在 8 月 1 日,OpenCode 这款 AI 编程工具仅在单个平台就消耗了 8 万亿 tokens,这是一个非常恐怖的量。其中有 5 万亿是优惠引流,另外 3 万亿是用户自费购买。这是一个什么样的概念呢?全球最大的 AI 聚合平台 OpenRouter.ai 上面几百个模型,单日的 tokens 总消耗量大概是 6.6 万亿。也就是说,OpenCode 这一个软件就超过了它整个平台的调用量。而且即便是在 OpenRouter.ai 上,排名第一的也是 DeepSeek V4 Flash,DeepSeek V4 Pro 也进入了前几名。再加上 DeepSeek 官方 API 的调用,以及庞大的第三方 DeepSeek 部署,可以说 DeepSeek 毫无疑问就是当下 AI 开源领域的王者。

                    DeepSeek算力危机.jpg

                    这位网友还提到了 DeepSeek 与投资人会议的录音,现在在网上被人转化成了 PDF 文件。我本来是不太相信这些边角料新闻的,因为这个 PDF 我早就看过。但是我今天搜索了一下网络,发现这个 PDF 在国内已经搜不到了,并且在豆包上也已经没有人谈论这个话题,如果你问它,它也会拒绝回答。这让我更加相信这件事可能是真的。

                    我又去认真看了一下那个文件。梁文锋认为,当下 DeepSeek 跟美国 AI 顶尖梯队的差距大概在一到两年的时间,他的目标是将差距缩小到半年甚至三个月,但要以 1/20 的成本去做到这一切。不过从 DeepSeek V4 Flash 正式版发布后的表现来看,梁文锋已经提前做到了,当下两者的差距大概就在半年左右。中国的一些顶级模型,比如 Kimi K3,它的跑分已经是跟 Claude Fabo5 达到了同一个档次,差距可能已经小于三个月了。

                    但是这只是当下,虽然我们看到中国的 AI 大模型非常红火,不仅在文本和通用大模型方面,在多模态领域,字节跳动的 Seedance 2.5 以及 MiniMax 最新开源的 H3,都掀起了互联网的讨论狂潮,可以说是好评如潮。

                    Minimax H3.avif

                    但事实上,中国的大模型确实是有危机的。就像梁文锋自己说的,他打算在今年年底去训练新一代的大模型(可能是 DeepSeek V5),目标是激活 150B 参数。那么当下的 DeepSeek V4 Pro 是一个什么样的水平呢?它是 1.4 万亿参数,但激活量只有 50B(大概 49B)。如果激活量要提升三倍的话,意味着模型整体规模可能会在 3 万亿到 4 万亿参数之间,这对算力的要求非常高。

                    当下中国最大的模型是 Kimi K3,参数大概在 2.7 万亿左右(在 2 万亿到 3 万亿之间),这还是要比美国模型小一半。美国的主流模型,无论是 xAI、Anthropic 还是 OpenAI,大概都在 5 万亿参数之上或附近,它们激活的参数同时都是几百 B。

                    要在今年年底去训练激活量为 150B 参数的新一代 DeepSeek 模型,目前我们知道的是,在美方禁令生效之前,DeepSeek 囤积了大概相当于 2 万张英伟达 A100 或 A800 芯片的集群算力。后来它有没有通过其他灰色渠道购买到新芯片,我们不得而知;仅从官方公布的数据来看,这些芯片是不足以同时支撑超大规模模型的训练和推理的。

                    AI计算集群.jpeg

                    不过今年华为确实开始加速向 DeepSeek 供货(即 950PR 推理芯片)。根据梁文锋自己的说法,华为大概给了他 16,000 张左右的芯片配额,这大概只相当于四五千张英伟达芯片,对于总体算力的缓解其实完全不够。但是 DeepSeek 也很想配合华为把生态做好,所以也在积极配合。如果今年能够加大供应,供应越多的华为 950PR,DeepSeek 就能够把更多的英伟达芯片解放出来,组建集群去训练下一代的 DeepSeek V5。

                    华为在今年四季度的年底,会向用户小批量交付 950DT 训练芯片。如果要上量的话,我估计要到明年之后了,这肯定是远水解不了近渴,DeepSeek 不可能等到华为 950DT 大批量交付之后才开始 V5 的训练。所以 DeepSeek 下一代主力模型的训练依然会基于英伟达架构,950DT 即便交付了,可能也只是承担一些辅助训练任务。

                    目前完全基于华为昇腾 910B/910C 国产生态训练的模型,有万亿参数的美团 LongCat 以及 7,440 亿参数的 GLM 5.2。虽然它们的跑分和评价都还不错,但毕竟参数总量还是比美国的模型小得多。

                    那么,是不是我们当下国产 AI 生态就会被英伟达给锁死呢?其实完全不是这样。就在那个会议录音的 PDF 文件里,梁文锋其实给出了完全相反的看法。梁文锋并不认为英伟达具备什么高深的护城河,其 CUDA 也不是什么不可超越的神话。事实上,DeepSeek 在早期曾经手写过 PTX(英伟达的汇编指令)去优化 CUDA 算子,但在 V3 和 V4 版本中,他们已经是使用国产的 TileLang 高级语言去写中间件了。也就是说,他们是用 TileLang 写的中间件去对接 PyTorch 以及底层的 ROCm、CUDA 或华为的 CANN 架构。目前这个工作根据梁文锋自己的说法已经是完成了大部分,可能还有一小部分没有完成,但可以确定 DeepSeek 是能够完全完成的。

                    华为测试deepseek.jpg

                    也就是说,即便是下一代的主力模型依然使用英伟达的旧卡生态来训练,也不妨碍等华为芯片的供应量充足之后,平滑地迁移到华为的训练集群上来。当然,中间难免有一些阵痛,就像这一次推理转换到华为 950PR 芯片带来的阵痛一样。有阵痛就会有收获,现在 DeepSeek 能够以这么低的价格承担这么庞大的用量请求,华为昇腾芯片可以说也交出了满意的答卷。

                    目前,中国的 DUV 已经完成了技术攻关,无论是干式还是浸润式的都投入了量产。EUV 光刻机之前传出造出了工程样机但没有流片成功,这是很早之前的传闻了,到现在我个人认为应当是流片成功并打通了整个流程,但是距离量产还是有比较远的距离。具体突破到什么程度,我们除了关注一些小道消息和花边新闻,还是要等待权威消息公布。

                    有的观众在视频下方留言说:如果华为能够通过落后制程的芯片,通过堆更大规模的集群来产生更大的算力,那么英伟达为什么不能这样做呢?他还特别提到英伟达的 NVLink 在今年四季度又要发布新产品,整个机柜的性能又有大大提升。

                    但是我想说,NVLink 本质上依然是电互联技术,传输的还是电信号,走的是铜缆。这一块无论怎么折腾、怎么提升效率,也只能提升一个小小的机柜。如果扩展到万卡集群,最终还是要走光互联方案。而在光互联这一块,华为的技术积累要远远强于英伟达。华为是做通信技术起家的,是世界上排名第一、远超第二名的通信企业,当年是从激烈的红海竞争中一路尸山血海杀过来的,先后击败了爱立信、诺基亚、摩托罗拉、思科等通信巨头。

                    33ed6631-d7bf-4431-8b7b-90315ca57fab-image.jpeg

                    华为走到今天这一步,付出了很大的代价,花了很长的时间。如果说中国突破西方的技术限制需要很长时间,那么西方想要在光互联技术上去赶上中国企业,其实也是比较困难的。目前世界排名靠前的几个光模块企业其实都是中国的。西方的 1.6T 光模块产品还在实验室阶段,还没有完全走入量产;而中国的 1.6T 光模块早就量产了,甚至 2.4T、3.2T 的产品已经研发完毕并送样华为,马上就要投入量产。这一块的差距是非常明显的。面对困难我们要实事求是,但我们也不至于妄自菲薄,有优势的地方还是要保持战略自信。

                    最后,我非常想开一个直播系列。因为我这个人是个嘴炮,就喜欢跟别人抬杠,但像现在这样对着镜头一个人讲实在不过瘾。你们在评论区打字,我在镜头前瞎聊,不够给劲。我在考虑要不要找一个语音软件,然后在论坛发个帖子让大家报名,到时候大家聚在一起聊聊天、切磋一下。或许在现场的一问一答中,更能表达清楚自己的想法。

                    先看着办吧,我得先锻炼一下自己面对镜头的能力。像老梁、王局他们,对着镜头娓娓道来,整个视频可能一刀未剪;而我做完一个视频,怎么也得剪个几十刀。先把这个能力锻炼上来吧。

                    在上期的视频评论区,有网友留言说他比较认同我关于中美两国 AI 大模型竞争态势的判断,即中国的大模型可能会以极低的价格和极致的性价比在竞争中占据优势地位;但他不太认同我关于两国硬件竞争的预判。他认为英伟达的 CUDA 生态护城河依然非常深,专利壁垒极强,中国企业尤其是华为想要突破是比较困难的。那么本期视频,我们就继续讨论一下这个话题。

                    Openrouter排名8-5.png

                    前几天,DeepSeek V4 Flash 正式版发布之后掀起了一股狂热的旋风,似乎整个网络都在使用。在 8 月 1 日,OpenCode 这款 AI 编程工具仅在单个平台就消耗了 8 万亿 tokens,这是一个非常恐怖的量。其中有 5 万亿是优惠引流,另外 3 万亿是用户自费购买。这是一个什么样的概念呢?全球最大的 AI 聚合平台 OpenRouter.ai 上面几百个模型,单日的 tokens 总消耗量大概是 6.6 万亿。也就是说,OpenCode 这一个软件就超过了它整个平台的调用量。而且即便是在 OpenRouter.ai 上,排名第一的也是 DeepSeek V4 Flash,DeepSeek V4 Pro 也进入了前几名。再加上 DeepSeek 官方 API 的调用,以及庞大的第三方 DeepSeek 部署,可以说 DeepSeek 毫无疑问就是当下 AI 开源领域的王者。

                    DeepSeek算力危机.jpg

                    这位网友还提到了 DeepSeek 与投资人会议的录音,现在在网上被人转化成了 PDF 文件。我本来是不太相信这些边角料新闻的,因为这个 PDF 我早就看过。但是我今天搜索了一下网络,发现这个 PDF 在国内已经搜不到了,并且在豆包上也已经没有人谈论这个话题,如果你问它,它也会拒绝回答。这让我更加相信这件事可能是真的。

                    我又去认真看了一下那个文件。梁文锋认为,当下 DeepSeek 跟美国 AI 顶尖梯队的差距大概在一到两年的时间,他的目标是将差距缩小到半年甚至三个月,但要以 1/20 的成本去做到这一切。不过从 DeepSeek V4 Flash 正式版发布后的表现来看,梁文锋已经提前做到了,当下两者的差距大概就在半年左右。中国的一些顶级模型,比如 Kimi K3,它的跑分已经是跟 Claude Fabo5 达到了同一个档次,差距可能已经小于三个月了。

                    但是这只是当下,虽然我们看到中国的 AI 大模型非常红火,不仅在文本和通用大模型方面,在多模态领域,字节跳动的 Seedance 2.5 以及 MiniMax 最新开源的 H3,都掀起了互联网的讨论狂潮,可以说是好评如潮。

                    Minimax H3.avif

                    但事实上,中国的大模型确实是有危机的。就像梁文锋自己说的,他打算在今年年底去训练新一代的大模型(可能是 DeepSeek V5),目标是激活 150B 参数。那么当下的 DeepSeek V4 Pro 是一个什么样的水平呢?它是 1.4 万亿参数,但激活量只有 50B(大概 49B)。如果激活量要提升三倍的话,意味着模型整体规模可能会在 3 万亿到 4 万亿参数之间,这对算力的要求非常高。

                    当下中国最大的模型是 Kimi K3,参数大概在 2.7 万亿左右(在 2 万亿到 3 万亿之间),这还是要比美国模型小一半。美国的主流模型,无论是 xAI、Anthropic 还是 OpenAI,大概都在 5 万亿参数之上或附近,它们激活的参数同时都是几百 B。

                    要在今年年底去训练激活量为 150B 参数的新一代 DeepSeek 模型,目前我们知道的是,在美方禁令生效之前,DeepSeek 囤积了大概相当于 2 万张英伟达 A100 或 A800 芯片的集群算力。后来它有没有通过其他灰色渠道购买到新芯片,我们不得而知;仅从官方公布的数据来看,这些芯片是不足以同时支撑超大规模模型的训练和推理的。

                    AI计算集群.jpeg

                    不过今年华为确实开始加速向 DeepSeek 供货(即 950PR 推理芯片)。根据梁文锋自己的说法,华为大概给了他 16,000 张左右的芯片配额,这大概只相当于四五千张英伟达芯片,对于总体算力的缓解其实完全不够。但是 DeepSeek 也很想配合华为把生态做好,所以也在积极配合。如果今年能够加大供应,供应越多的华为 950PR,DeepSeek 就能够把更多的英伟达芯片解放出来,组建集群去训练下一代的 DeepSeek V5。

                    华为在今年四季度的年底,会向用户小批量交付 950DT 训练芯片。如果要上量的话,我估计要到明年之后了,这肯定是远水解不了近渴,DeepSeek 不可能等到华为 950DT 大批量交付之后才开始 V5 的训练。所以 DeepSeek 下一代主力模型的训练依然会基于英伟达架构,950DT 即便交付了,可能也只是承担一些辅助训练任务。

                    目前完全基于华为昇腾 910B/910C 国产生态训练的模型,有万亿参数的美团 LongCat 以及 7,440 亿参数的 GLM 5.2。虽然它们的跑分和评价都还不错,但毕竟参数总量还是比美国的模型小得多。

                    那么,是不是我们当下国产 AI 生态就会被英伟达给锁死呢?其实完全不是这样。就在那个会议录音的 PDF 文件里,梁文锋其实给出了完全相反的看法。梁文锋并不认为英伟达具备什么高深的护城河,其 CUDA 也不是什么不可超越的神话。事实上,DeepSeek 在早期曾经手写过 PTX(英伟达的汇编指令)去优化 CUDA 算子,但在 V3 和 V4 版本中,他们已经是使用国产的 TileLang 高级语言去写中间件了。也就是说,他们是用 TileLang 写的中间件去对接 PyTorch 以及底层的 ROCm、CUDA 或华为的 CANN 架构。目前这个工作根据梁文锋自己的说法已经是完成了大部分,可能还有一小部分没有完成,但可以确定 DeepSeek 是能够完全完成的。

                    华为测试deepseek.jpg

                    也就是说,即便是下一代的主力模型依然使用英伟达的旧卡生态来训练,也不妨碍等华为芯片的供应量充足之后,平滑地迁移到华为的训练集群上来。当然,中间难免有一些阵痛,就像这一次推理转换到华为 950PR 芯片带来的阵痛一样。有阵痛就会有收获,现在 DeepSeek 能够以这么低的价格承担这么庞大的用量请求,华为昇腾芯片可以说也交出了满意的答卷。

                    目前,中国的 DUV 已经完成了技术攻关,无论是干式还是浸润式的都投入了量产。EUV 光刻机之前传出造出了工程样机但没有流片成功,这是很早之前的传闻了,到现在我个人认为应当是流片成功并打通了整个流程,但是距离量产还是有比较远的距离。具体突破到什么程度,我们除了关注一些小道消息和花边新闻,还是要等待权威消息公布。

                    有的观众在视频下方留言说:如果华为能够通过落后制程的芯片,通过堆更大规模的集群来产生更大的算力,那么英伟达为什么不能这样做呢?他还特别提到英伟达的 NVLink 在今年四季度又要发布新产品,整个机柜的性能又有大大提升。

                    但是我想说,NVLink 本质上依然是电互联技术,传输的还是电信号,走的是铜缆。这一块无论怎么折腾、怎么提升效率,也只能提升一个小小的机柜。如果扩展到万卡集群,最终还是要走光互联方案。而在光互联这一块,华为的技术积累要远远强于英伟达。华为是做通信技术起家的,是世界上排名第一、远超第二名的通信企业,当年是从激烈的红海竞争中一路尸山血海杀过来的,先后击败了爱立信、诺基亚、摩托罗拉、思科等通信巨头。

                    33ed6631-d7bf-4431-8b7b-90315ca57fab-image.jpeg

                    华为走到今天这一步,付出了很大的代价,花了很长的时间。如果说中国突破西方的技术限制需要很长时间,那么西方想要在光互联技术上去赶上中国企业,其实也是比较困难的。目前世界排名靠前的几个光模块企业其实都是中国的。西方的 1.6T 光模块产品还在实验室阶段,还没有完全走入量产;而中国的 1.6T 光模块早就量产了,甚至 2.4T、3.2T 的产品已经研发完毕并送样华为,马上就要投入量产。这一块的差距是非常明显的。面对困难我们要实事求是,但我们也不至于妄自菲薄,有优势的地方还是要保持战略自信。

                    最后,我非常想开一个直播系列。因为我这个人是个嘴炮,就喜欢跟别人抬杠,但像现在这样对着镜头一个人讲实在不过瘾。你们在评论区打字,我在镜头前瞎聊,不够给劲。我在考虑要不要找一个语音软件,然后在论坛发个帖子让大家报名,到时候大家聚在一起聊聊天、切磋一下。或许在现场的一问一答中,更能表达清楚自己的想法。

                    先看着办吧,我得先锻炼一下自己面对镜头的能力。像老梁、王局他们,对着镜头娓娓道来,整个视频可能一刀未剪;而我做完一个视频,怎么也得剪个几十刀。先把这个能力锻炼上来吧。

                    seewoscottS 离线
                    seewoscottS 离线
                    seewoscott
                    编写于 最后由 编辑
                    #9

                    @terry 说:

                    Anthropic 还是 OpenAI,大概都在 5 万亿参数之上或附近

                    这两家公司的模型参数,我一直没有找到相关信息源。从来都是黑盒,这个信息是在哪里可以看到?😂

                    1 条回复 最后回复
                    0
                    • stxpnetS 在线
                      stxpnetS 在线
                      stxpnet
                      超凡大师
                      编写于 最后由 stxpnet 编辑
                      #10

                      这样说感觉是梁子要操作他的幻方量化,这也是跟特朗普学的,利用影响力画画K线图玩,毕竟deepseek刚刚秀完肌肉(真的很强)。要抓住这个窗口多搞几波操作,把建数据中心的成本捞一点回来。

                      26-08-19
                      双卡3090(8x8x无nvlink,p2p驱动) +Sglang+qwen 3.8 27B awq模型 [功耗异常弃用]
                      8-20 用vllm 0.26+ Qwen3.8-27B-SmoothQuant-W8A8-INT8 200K上下文 ~50t/s

                      1 条回复 最后回复
                      0

                      你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

                      厌倦了每次访问都刷到同样的帖子?您注册账号后,您每次返回时都能精准定位到您上次浏览的位置,并可选择接收新回复通知(通过邮件或推送通知)。您还能收藏书签、为帖子顶,向社区成员表达您的欣赏。

                      有了你的建议,这篇帖子会更精彩哦 💗

                      注册 登录
                      回复
                      • 在新帖中回复
                      登录后回复
                      • 从旧到新
                      • 从新到旧
                      • 最多赞同


                      • 登录

                      • 登录或注册以进行搜索。
                      • 第一个帖子
                        最后一个帖子
                      0
                      • 版块
                      • 最新
                      • 标签
                      • 热门
                      • 用户
                      • 群组