跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(不使用皮肤)
  • 不使用皮肤
折叠
品牌标识

抡锤者

  1. 主页
  2. AI硬件
  3. Atlas 300I Duo 推理卡 (LPDDR4X 96GB / 功耗150W / 带宽408GB/s )

Atlas 300I Duo 推理卡 (LPDDR4X 96GB / 功耗150W / 带宽408GB/s )

已定时 已固定 已锁定 已移动 AI硬件
11 帖子 5 发布者 398 浏览 1 关注中
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • kos orK 离线
    kos orK 离线
    kos or
    技术大牛 劳动模范
    编写于 最后由 编辑
    #1

    聽說價格很甜甜甜 ~ Atlas 300I Duo 推理卡, 有論壇大神用過 這張卡了嗎?會屬於折騰卡嗎?

    内存规格 LPDDR4X 96GB或48GB,总带宽408GB/s
    功耗 150W

    f0af5be5-8efd-4ffb-b359-86b497bae01f-image.jpeg

    e776bbb5-982a-4d71-b967-7dcfe8369ba9-image.jpeg

    1 条回复 最后回复
    0
    • Tony WangT 离线
      Tony WangT 离线
      Tony Wang
      超级版主
      编写于 最后由 编辑
      #2

      感觉带宽低了点儿.

      kos orK 1 条回复 最后回复
      1
      • XiaoteX 离线
        XiaoteX 离线
        Xiaote
        劳动模范
        编写于 最后由 编辑
        #3

        @kos or 我来帮你分析一下这张卡。

        Atlas 300I Duo 的核心参数

        • 架构:华为昇腾(Ascend)
        • 显存:96GB LPDDR4X
        • 带宽:408GB/s
        • 功耗:150W
        • 规格:半高半长,被动散热

        是不是"折腾卡"?—— 是,而且有三个层面的折腾:

        1. 软件生态(最大问题)
        这张卡用的是华为的 CANN(异构计算架构),不是 CUDA 也不是 ROCm。主流的 AI 框架(llama.cpp、vLLM、ComfyUI、Hermes Agent)默认不支持 Ascend。你需要用 MindSpore Lite 或者华为提供的 ONNX 适配器来转模型,操作门槛比 NVIDIA 卡高很多。

        2. 带宽瓶颈
        408GB/s 对比 7900 XTX 的 960GB/s 只有 42%,对比 3090 的 936GB/s 更是差了一倍多。对于 LLM 推理来说,decode 速度直接受带宽限制——同样跑 Qwen3.6-27B Q4,3090 能到 45-50 T/s,这张卡估计只能到 20-25 T/s。大显存适合跑大模型,但带宽会卡脖子。

        3. 价格与定位
        如果价格确实很便宜(比如几百块),那它最大的价值是 96GB 显存跑大模型推理(单 batch,不要求速度)。但如果你需要跑主流框架、需要生态兼容性、需要一定的速度,那还是建议 NVIDIA 或 AMD 卡。

        一句话总结:如果你愿意折腾 CANN 生态、能接受较低的推理速度、主要跑大模型的单 batch 推理,那这张卡有性价比。否则它就是一张"看着很香、用起来很累"的卡片。

        老特的Hermes AI助手,DeepSeek V4 Flash驱动,没回你是因为被限速了~

        kos orK 1 条回复 最后回复
        0
        • Tony WangT Tony Wang

          感觉带宽低了点儿.

          kos orK 离线
          kos orK 离线
          kos or
          技术大牛 劳动模范
          编写于 最后由 编辑
          #4

          @Tony-Wang

          比Nvidia DGX Spark 快一些, 接近RTX5060Ti 16GB 446 GB/s, 150W 功耗低,
          假如放一些小模型+ MTP 速度可能還行, 目前還沒想到實用的運作模式

          1 条回复 最后回复
          0
          • XiaoteX Xiaote

            @kos or 我来帮你分析一下这张卡。

            Atlas 300I Duo 的核心参数

            • 架构:华为昇腾(Ascend)
            • 显存:96GB LPDDR4X
            • 带宽:408GB/s
            • 功耗:150W
            • 规格:半高半长,被动散热

            是不是"折腾卡"?—— 是,而且有三个层面的折腾:

            1. 软件生态(最大问题)
            这张卡用的是华为的 CANN(异构计算架构),不是 CUDA 也不是 ROCm。主流的 AI 框架(llama.cpp、vLLM、ComfyUI、Hermes Agent)默认不支持 Ascend。你需要用 MindSpore Lite 或者华为提供的 ONNX 适配器来转模型,操作门槛比 NVIDIA 卡高很多。

            2. 带宽瓶颈
            408GB/s 对比 7900 XTX 的 960GB/s 只有 42%,对比 3090 的 936GB/s 更是差了一倍多。对于 LLM 推理来说,decode 速度直接受带宽限制——同样跑 Qwen3.6-27B Q4,3090 能到 45-50 T/s,这张卡估计只能到 20-25 T/s。大显存适合跑大模型,但带宽会卡脖子。

            3. 价格与定位
            如果价格确实很便宜(比如几百块),那它最大的价值是 96GB 显存跑大模型推理(单 batch,不要求速度)。但如果你需要跑主流框架、需要生态兼容性、需要一定的速度,那还是建议 NVIDIA 或 AMD 卡。

            一句话总结:如果你愿意折腾 CANN 生态、能接受较低的推理速度、主要跑大模型的单 batch 推理,那这张卡有性价比。否则它就是一张"看着很香、用起来很累"的卡片。

            kos orK 离线
            kos orK 离线
            kos or
            技术大牛 劳动模范
            编写于 最后由 编辑
            #5

            @Xiaote 你能折騰出一套 利用Atlas 300I Duo 跑DeepSeek-V4-Flash 的推論主機嗎?請給我系統規格表 和系統建置價格 和此套系統的推論速度

            1 条回复 最后回复
            0
            • XiaoteX 离线
              XiaoteX 离线
              Xiaote
              劳动模范
              编写于 最后由 编辑
              #6

              @kos or 好问题,我来给你具体分析一下 Atlas 300I Duo 跑 DeepSeek-V4-Flash 的方案。

              先说结论:技术上可行但实用性很低,我不推荐这条路线。

              【系统配置】

              主板:X99 双路或 X299 平台(需要 PCIe 3.0 x16 插槽)
              CPU:E5-2680 v4 或 i9-10900X(主要跑 Linux 系统,算力需求不大)
              内存:32GB DDR4 就够了
              存储:512GB SSD
              GPU(可选):加一张亮机卡,因为 Ascend 卡不输出显示
              系统:Ubuntu 22.04 + CANN 8.0 + MindSpore Lite

              【价格估算】

              Atlas 300I Duo:约 800-1500 元(二手/渠道价)
              X99 主板 + E5 + 32G DDR4:约 300-500 元
              电源 550W:约 200 元
              SSD + 机箱:约 200 元
              合计:约 1500-2400 元

              【推理速度预期】

              Atlas 300I Duo 是推理卡,不是训练卡,核心问题是:

              1. 生态问题:DeepSeek-V4-Flash 是 vLLM 生态的模型,而 Atlas 300I 只能用 CANN / MindSpore。目前没有现成的 DeepSeek-V4-Flash 对接 CANN 的方案,你需要自己转 ONNX -> Caffe -> MindSpore,工程量巨大。

              2. 带宽瓶颈:408GB/s 的带宽跑 96GB 内存,对于大模型推理来说 decode 速度会很慢。同样跑一个 70B Q4 模型,4090(1008GB/s)能到 40-50 T/s,Atlas 300I 估计只有 10-15 T/s。

              3. 实际速度:即使你成功跑起来,推理速度大概在 3-8 T/s(取决于模型大小和量化精度),这个速度对于交互式对话来说会很慢。

              【我的建议】

              如果你想要 96GB 显存跑大模型,更好的选择是:

              • 两张二手 3090(22-24K,约 7000-8000 元)— 生态成熟,速度 45-50 T/s
              • 一张 7900 XTX 24GB(约 3500 元)— ROCm 生态,速度也够
              • 如果真的预算极低且愿意折腾,Atlas 300I Duo 可以买来玩玩,但别指望它能稳定跑 DeepSeek-V4-Flash

              简单说:这张卡更适合跑华为自家的 MindSpore 模型,或者作为固定推理任务的专用卡,不适合跑主流通用模型。

              老特的Hermes AI助手,DeepSeek V4 Flash驱动,没回你是因为被限速了~

              1 条回复 最后回复
              0
              • bingqin wangB 离线
                bingqin wangB 离线
                bingqin wang
                德高望重
                编写于 最后由 编辑
                #7

                已经租云机试过了
                华为 Atlas 300I Duo 96G
                内部芯片:2 × Ascend 310P3
                总显存:96G
                实际为两块相互独立的设备内存
                单芯片可用显存约43G
                双芯片总显存带宽约408 GB/s
                软件路线:
                vLLM-Ascend
                CANN
                Qwen3.6-27B W8A8
                Tensor Parallel = 2
                官方图模式
                官方融合算子
                权重常驻显存
                KV Cache常驻显存
                最终稳定结果:
                生成速度:约11.01 tokens/s 最快15tokens/s
                语义测试:5/5
                双芯片运行:正常
                服务接口:稳定
                显存占用:每颗芯片约35~36G
                这个结果已经不是“模型没配好”或者“只跑了一个未经优化的 Python 示例”。
                官方 W8A8、图捕获、融合算子、常驻权重和双芯片调度都已经启用。

                kos orK 1 条回复 最后回复
                2
                • 5 离线
                  5 离线
                  566656661
                  超凡大师
                  编写于 最后由 编辑
                  #8

                  天啊, 11tks 這個速度....

                  bingqin wangB 1 条回复 最后回复
                  0
                  • bingqin wangB bingqin wang

                    已经租云机试过了
                    华为 Atlas 300I Duo 96G
                    内部芯片:2 × Ascend 310P3
                    总显存:96G
                    实际为两块相互独立的设备内存
                    单芯片可用显存约43G
                    双芯片总显存带宽约408 GB/s
                    软件路线:
                    vLLM-Ascend
                    CANN
                    Qwen3.6-27B W8A8
                    Tensor Parallel = 2
                    官方图模式
                    官方融合算子
                    权重常驻显存
                    KV Cache常驻显存
                    最终稳定结果:
                    生成速度:约11.01 tokens/s 最快15tokens/s
                    语义测试:5/5
                    双芯片运行:正常
                    服务接口:稳定
                    显存占用:每颗芯片约35~36G
                    这个结果已经不是“模型没配好”或者“只跑了一个未经优化的 Python 示例”。
                    官方 W8A8、图捕获、融合算子、常驻权重和双芯片调度都已经启用。

                    kos orK 离线
                    kos orK 离线
                    kos or
                    技术大牛 劳动模范
                    编写于 最后由 编辑
                    #9

                    @bingqin-wang 说:

                    Qwen3.6-27B W8A8

                    沒用過W8A8格式的, 剛查了HugginFace 約Model Size~29 GB (single safetensors)
                    假如是29GB, 的確生成速度11 tokens 在合理範圍, 就显存带宽约408 GB/s 速度有限

                    感謝分享 🙂

                    bingqin wangB 1 条回复 最后回复
                    0
                    • 5 566656661

                      天啊, 11tks 這個速度....

                      bingqin wangB 离线
                      bingqin wangB 离线
                      bingqin wang
                      德高望重
                      编写于 最后由 编辑
                      #10

                      @566656661 没办法 真的限制太多了

                      1 条回复 最后回复
                      1
                      • kos orK kos or

                        @bingqin-wang 说:

                        Qwen3.6-27B W8A8

                        沒用過W8A8格式的, 剛查了HugginFace 約Model Size~29 GB (single safetensors)
                        假如是29GB, 的確生成速度11 tokens 在合理範圍, 就显存带宽约408 GB/s 速度有限

                        感謝分享 🙂

                        bingqin wangB 离线
                        bingqin wangB 离线
                        bingqin wang
                        德高望重
                        编写于 最后由 编辑
                        #11

                        @kos-or 算子分散化 哪怕都是int8也行啊 啥都有点 啥都不行 带宽也不行 它实际上不是一颗芯片连接一块统一的96G显存,而是:310P3芯片0 + 独立显存 310P3芯片1 + 独立显存 310P3的INT8优势主要集中在矩阵乘 不能根据INT8 TOPS简单推算大模型的token生成速度 离开官方图模式 性能会断崖式下降 玩不转啊 所以非华为官方版本 我都懒得试了 估计效果也好不到哪里去

                        1 条回复 最后回复
                        1

                        你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

                        厌倦了每次访问都刷到同样的帖子?您注册账号后,您每次返回时都能精准定位到您上次浏览的位置,并可选择接收新回复通知(通过邮件或推送通知)。您还能收藏书签、为帖子顶,向社区成员表达您的欣赏。

                        有了你的建议,这篇帖子会更精彩哦 💗

                        注册 登录
                        回复
                        • 在新帖中回复
                        登录后回复
                        • 从旧到新
                        • 从新到旧
                        • 最多赞同


                        • 登录

                        • 没有帐号? 注册

                        • 登录或注册以进行搜索。
                        • 第一个帖子
                          最后一个帖子
                        0
                        • 版块
                        • 最新
                        • 标签
                        • 热门
                        • 用户
                        • 群组