跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(不使用皮肤)
  • 不使用皮肤
折叠
品牌标识

抡锤者

bingqin wangB

bingqin wang

@bingqin wang
德高望重
取消关注 关注
关于
帖子
14
主题
1
分享
0
群组
1
粉丝
0
关注
0

帖子

最新 最佳 有争议的

  • Atlas 300I Duo 推理卡 (LPDDR4X 96GB / 功耗150W / 带宽408GB/s )
    bingqin wangB bingqin wang

    已经租云机试过了
    华为 Atlas 300I Duo 96G
    内部芯片:2 × Ascend 310P3
    总显存:96G
    实际为两块相互独立的设备内存
    单芯片可用显存约43G
    双芯片总显存带宽约408 GB/s
    软件路线:
    vLLM-Ascend
    CANN
    Qwen3.6-27B W8A8
    Tensor Parallel = 2
    官方图模式
    官方融合算子
    权重常驻显存
    KV Cache常驻显存
    最终稳定结果:
    生成速度:约11.01 tokens/s 最快15tokens/s
    语义测试:5/5
    双芯片运行:正常
    服务接口:稳定
    显存占用:每颗芯片约35~36G
    这个结果已经不是“模型没配好”或者“只跑了一个未经优化的 Python 示例”。
    官方 W8A8、图捕获、融合算子、常驻权重和双芯片调度都已经启用。

    AI硬件

  • Atlas 300I Duo 推理卡 (LPDDR4X 96GB / 功耗150W / 带宽408GB/s )
    bingqin wangB bingqin wang

    @kos-or 算子分散化 哪怕都是int8也行啊 啥都有点 啥都不行 带宽也不行 它实际上不是一颗芯片连接一块统一的96G显存,而是:310P3芯片0 + 独立显存 310P3芯片1 + 独立显存 310P3的INT8优势主要集中在矩阵乘 不能根据INT8 TOPS简单推算大模型的token生成速度 离开官方图模式 性能会断崖式下降 玩不转啊 所以非华为官方版本 我都懒得试了 估计效果也好不到哪里去

    AI硬件

  • Atlas 300I Duo 推理卡 (LPDDR4X 96GB / 功耗150W / 带宽408GB/s )
    bingqin wangB bingqin wang

    @566656661 没办法 真的限制太多了

    AI硬件

  • 刚把推理引擎跑到15 token/s,新人发帖想听听大家的意见
    bingqin wangB bingqin wang

    @566656661 果然是专家 确实是非浮点运算 但是比您说的这种更极端 我从数学底层把所有乘除和微分计算都换成了有限加法表达的公式 也就是全面离散数学化 非线性计算用了一部分查表 我的目标是NPU 利用CANN算子做优化 这样有俩个好处1.可以最大避免带宽影响大力出奇迹 2.所有结果计算可审计 相同的seed得到的答案完全一致 比较适合高确定性场景

    LLM讨论区

  • 刚把推理引擎跑到15 token/s,新人发帖想听听大家的意见
    bingqin wangB bingqin wang

    @kos-or 其实说白了就是穷的 我就想现在不是升腾的加速卡便宜 看看能不能想办法把不到一万块的96g显存用起来 不求n卡的速度 起码能用就是胜利 一分钱一分货 能用就行

    LLM讨论区

  • 刚把推理引擎跑到15 token/s,新人发帖想听听大家的意见
    bingqin wangB bingqin wang

    @kos-or 这卡目前来看 除了显存大 貌似就都是骂 没看到社区有夸优点的

    LLM讨论区

  • 刚把推理引擎跑到15 token/s,新人发帖想听听大家的意见
    bingqin wangB bingqin wang

    @566656661 CANN社区他们内部开发人员都吐槽 别提了 但是没钱买显卡 这是硬伤

    LLM讨论区

  • 两周变现成功。。简单分享最近实践的感悟
    bingqin wangB bingqin wang

    牛逼牛逼 能赚钱的都是高人 我压根都不敢奢望 除了产片儿以外 完全想不到顺畅一点的变现手段

    网络技术

  • 刚把推理引擎跑到15 token/s,新人发帖想听听大家的意见
    bingqin wangB bingqin wang

    不求能追上CUDA 只要大概能跑 没有过于忍不了的延迟就行 特别是国内单位 现在都必须全国产 所以这问题早晚得解决

    LLM讨论区
  • 登录

  • 没有帐号? 注册

  • 登录或注册以进行搜索。
  • 第一个帖子
    最后一个帖子
0
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组