@kos-or 算子分散化 哪怕都是int8也行啊 啥都有点 啥都不行 带宽也不行 它实际上不是一颗芯片连接一块统一的96G显存,而是:310P3芯片0 + 独立显存 310P3芯片1 + 独立显存 310P3的INT8优势主要集中在矩阵乘 不能根据INT8 TOPS简单推算大模型的token生成速度 离开官方图模式 性能会断崖式下降 玩不转啊 所以非华为官方版本 我都懒得试了 估计效果也好不到哪里去
-
Atlas 300I Duo 推理卡 (LPDDR4X 96GB / 功耗150W / 带宽408GB/s ) -
Atlas 300I Duo 推理卡 (LPDDR4X 96GB / 功耗150W / 带宽408GB/s )@566656661 没办法 真的限制太多了
-
Atlas 300I Duo 推理卡 (LPDDR4X 96GB / 功耗150W / 带宽408GB/s )已经租云机试过了
华为 Atlas 300I Duo 96G
内部芯片:2 × Ascend 310P3
总显存:96G
实际为两块相互独立的设备内存
单芯片可用显存约43G
双芯片总显存带宽约408 GB/s
软件路线:
vLLM-Ascend
CANN
Qwen3.6-27B W8A8
Tensor Parallel = 2
官方图模式
官方融合算子
权重常驻显存
KV Cache常驻显存
最终稳定结果:
生成速度:约11.01 tokens/s 最快15tokens/s
语义测试:5/5
双芯片运行:正常
服务接口:稳定
显存占用:每颗芯片约35~36G
这个结果已经不是“模型没配好”或者“只跑了一个未经优化的 Python 示例”。
官方 W8A8、图捕获、融合算子、常驻权重和双芯片调度都已经启用。 -
两周变现成功。。简单分享最近实践的感悟牛逼牛逼 能赚钱的都是高人 我压根都不敢奢望 除了产片儿以外 完全想不到顺畅一点的变现手段
-
刚把推理引擎跑到15 token/s,新人发帖想听听大家的意见不求能追上CUDA 只要大概能跑 没有过于忍不了的延迟就行 特别是国内单位 现在都必须全国产 所以这问题早晚得解决
-
刚把推理引擎跑到15 token/s,新人发帖想听听大家的意见@566656661 CANN社区他们内部开发人员都吐槽 别提了 但是没钱买显卡 这是硬伤
-
刚把推理引擎跑到15 token/s,新人发帖想听听大家的意见@kos-or 这卡目前来看 除了显存大 貌似就都是骂 没看到社区有夸优点的
-
刚把推理引擎跑到15 token/s,新人发帖想听听大家的意见@kos-or 其实说白了就是穷的 我就想现在不是升腾的加速卡便宜 看看能不能想办法把不到一万块的96g显存用起来 不求n卡的速度 起码能用就是胜利 一分钱一分货 能用就行
-
關於去馬賽克对了 有个老牌子JavPlayer 也可以试试 我也好奇这个和Lada对比怎么样
-
關於去馬賽克目前我知道的靠连续扩散算法补充图像的办法应该是可以做到的 但是需要有一个微调的模型 因为本质上不是去掉马赛克 而是在马赛克的基础上进行创作并补齐 所以用本地部署的通用模型 大概率细节上会有些对不上 云端的算力够 但是不知能不能过审
-
分享一下我折腾RAG的不成功经验我正好有个开源项目适合大佬的需求 你可以试试 我做了封装 直接安装就能用 知识入网里面有协议 直接用agent自己读协议工作比较省力https://github.com/superalp1985/fame-knowledge-agent-gateway
-
刚把推理引擎跑到15 token/s,新人发帖想听听大家的意见@566656661 果然是专家 确实是非浮点运算 但是比您说的这种更极端 我从数学底层把所有乘除和微分计算都换成了有限加法表达的公式 也就是全面离散数学化 非线性计算用了一部分查表 我的目标是NPU 利用CANN算子做优化 这样有俩个好处1.可以最大避免带宽影响大力出奇迹 2.所有结果计算可审计 相同的seed得到的答案完全一致 比较适合高确定性场景
-
刚把推理引擎跑到15 token/s,新人发帖想听听大家的意见@terry 感谢老大 你的视频对我帮助也很大 少踩了不少坑 你太谦虚了
-
刚把推理引擎跑到15 token/s,新人发帖想听听大家的意见大家好,第一次在论坛发帖,有点紧张,有什么不对的地方请大家多包涵。
我一直对LLM推理很感兴趣,自己动手写了一个极简的推理引擎。因为对数值计算有点执念,我走了一条比较偏门的路子——尽可能把浮点运算都换成整数和定点数(像Q8.8/Q16这种),想看看在纯CPU上能跑成什么样。
折腾了一段时间,目前的情况是这样的:
速度:在我的台式机CPU上,2B大小的模型能稳定跑到 15+ token/s,最低也在10以上
确定性:因为全是整数运算,我做了Trace Hash校验,结果是一致的
语义:简单对比过,和浮点版本的输出差异不大,没有明显崩坏
我知道这个速度不算惊艳,毕竟只是个2B小模型,而且CPU跑大模型本来就不现实。但我自己觉得这条路好像可以继续往下走——接下来想试试27B的模型,还有昇腾那边的NPU,也在关注Tenstorrent,感觉他们的分层计算思路和我的方向有点契合。
我发这个帖子,主要是想请大家帮我看看:
这种“全部用整数算”的方向,你们觉得有实际落地的价值吗?还是说只是我个人的玩具?
如果我想往NPU上移植,有没有什么是你们觉得最该提前注意的坑?
论坛里有没有同样在搞推理引擎的朋友,想交个朋友,互相学习一下
代码还很糙,暂时没好意思发出来,等再打磨一下我再开源吧,目前有个验证版的开源https://github.com/superalp1985/DCA-Inference-Engine。谢谢大家看完,希望没占用你们太多时间。