已经租云机试过了
华为 Atlas 300I Duo 96G
内部芯片:2 × Ascend 310P3
总显存:96G
实际为两块相互独立的设备内存
单芯片可用显存约43G
双芯片总显存带宽约408 GB/s
软件路线:
vLLM-Ascend
CANN
Qwen3.6-27B W8A8
Tensor Parallel = 2
官方图模式
官方融合算子
权重常驻显存
KV Cache常驻显存
最终稳定结果:
生成速度:约11.01 tokens/s 最快15tokens/s
语义测试:5/5
双芯片运行:正常
服务接口:稳定
显存占用:每颗芯片约35~36G
这个结果已经不是“模型没配好”或者“只跑了一个未经优化的 Python 示例”。
官方 W8A8、图捕获、融合算子、常驻权重和双芯片调度都已经启用。
-
Atlas 300I Duo 推理卡 (LPDDR4X 96GB / 功耗150W / 带宽408GB/s ) -
Atlas 300I Duo 推理卡 (LPDDR4X 96GB / 功耗150W / 带宽408GB/s )@kos-or 算子分散化 哪怕都是int8也行啊 啥都有点 啥都不行 带宽也不行 它实际上不是一颗芯片连接一块统一的96G显存,而是:310P3芯片0 + 独立显存 310P3芯片1 + 独立显存 310P3的INT8优势主要集中在矩阵乘 不能根据INT8 TOPS简单推算大模型的token生成速度 离开官方图模式 性能会断崖式下降 玩不转啊 所以非华为官方版本 我都懒得试了 估计效果也好不到哪里去
-
Atlas 300I Duo 推理卡 (LPDDR4X 96GB / 功耗150W / 带宽408GB/s )@566656661 没办法 真的限制太多了
-
刚把推理引擎跑到15 token/s,新人发帖想听听大家的意见@566656661 果然是专家 确实是非浮点运算 但是比您说的这种更极端 我从数学底层把所有乘除和微分计算都换成了有限加法表达的公式 也就是全面离散数学化 非线性计算用了一部分查表 我的目标是NPU 利用CANN算子做优化 这样有俩个好处1.可以最大避免带宽影响大力出奇迹 2.所有结果计算可审计 相同的seed得到的答案完全一致 比较适合高确定性场景
-
刚把推理引擎跑到15 token/s,新人发帖想听听大家的意见@kos-or 其实说白了就是穷的 我就想现在不是升腾的加速卡便宜 看看能不能想办法把不到一万块的96g显存用起来 不求n卡的速度 起码能用就是胜利 一分钱一分货 能用就行
-
刚把推理引擎跑到15 token/s,新人发帖想听听大家的意见@kos-or 这卡目前来看 除了显存大 貌似就都是骂 没看到社区有夸优点的
-
刚把推理引擎跑到15 token/s,新人发帖想听听大家的意见@566656661 CANN社区他们内部开发人员都吐槽 别提了 但是没钱买显卡 这是硬伤
-
两周变现成功。。简单分享最近实践的感悟牛逼牛逼 能赚钱的都是高人 我压根都不敢奢望 除了产片儿以外 完全想不到顺畅一点的变现手段
-
刚把推理引擎跑到15 token/s,新人发帖想听听大家的意见不求能追上CUDA 只要大概能跑 没有过于忍不了的延迟就行 特别是国内单位 现在都必须全国产 所以这问题早晚得解决