跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(不使用皮肤)
  • 不使用皮肤
折叠
品牌标识

抡锤者

bingqin wangB

bingqin wang

@bingqin wang
德高望重
取消关注 关注
关于
帖子
14
主题
1
分享
0
群组
1
粉丝
0
关注
0

帖子

最新 最佳 有争议的

  • Atlas 300I Duo 推理卡 (LPDDR4X 96GB / 功耗150W / 带宽408GB/s )
    bingqin wangB bingqin wang

    @kos-or 算子分散化 哪怕都是int8也行啊 啥都有点 啥都不行 带宽也不行 它实际上不是一颗芯片连接一块统一的96G显存,而是:310P3芯片0 + 独立显存 310P3芯片1 + 独立显存 310P3的INT8优势主要集中在矩阵乘 不能根据INT8 TOPS简单推算大模型的token生成速度 离开官方图模式 性能会断崖式下降 玩不转啊 所以非华为官方版本 我都懒得试了 估计效果也好不到哪里去

    AI硬件

  • Atlas 300I Duo 推理卡 (LPDDR4X 96GB / 功耗150W / 带宽408GB/s )
    bingqin wangB bingqin wang

    @566656661 没办法 真的限制太多了

    AI硬件

  • Atlas 300I Duo 推理卡 (LPDDR4X 96GB / 功耗150W / 带宽408GB/s )
    bingqin wangB bingqin wang

    已经租云机试过了
    华为 Atlas 300I Duo 96G
    内部芯片:2 × Ascend 310P3
    总显存:96G
    实际为两块相互独立的设备内存
    单芯片可用显存约43G
    双芯片总显存带宽约408 GB/s
    软件路线:
    vLLM-Ascend
    CANN
    Qwen3.6-27B W8A8
    Tensor Parallel = 2
    官方图模式
    官方融合算子
    权重常驻显存
    KV Cache常驻显存
    最终稳定结果:
    生成速度:约11.01 tokens/s 最快15tokens/s
    语义测试:5/5
    双芯片运行:正常
    服务接口:稳定
    显存占用:每颗芯片约35~36G
    这个结果已经不是“模型没配好”或者“只跑了一个未经优化的 Python 示例”。
    官方 W8A8、图捕获、融合算子、常驻权重和双芯片调度都已经启用。

    AI硬件

  • 两周变现成功。。简单分享最近实践的感悟
    bingqin wangB bingqin wang

    牛逼牛逼 能赚钱的都是高人 我压根都不敢奢望 除了产片儿以外 完全想不到顺畅一点的变现手段

    网络技术

  • 刚把推理引擎跑到15 token/s,新人发帖想听听大家的意见
    bingqin wangB bingqin wang

    不求能追上CUDA 只要大概能跑 没有过于忍不了的延迟就行 特别是国内单位 现在都必须全国产 所以这问题早晚得解决

    LLM讨论区

  • 刚把推理引擎跑到15 token/s,新人发帖想听听大家的意见
    bingqin wangB bingqin wang

    @566656661 CANN社区他们内部开发人员都吐槽 别提了 但是没钱买显卡 这是硬伤

    LLM讨论区

  • 刚把推理引擎跑到15 token/s,新人发帖想听听大家的意见
    bingqin wangB bingqin wang

    @kos-or 这卡目前来看 除了显存大 貌似就都是骂 没看到社区有夸优点的

    LLM讨论区

  • 刚把推理引擎跑到15 token/s,新人发帖想听听大家的意见
    bingqin wangB bingqin wang

    @kos-or 其实说白了就是穷的 我就想现在不是升腾的加速卡便宜 看看能不能想办法把不到一万块的96g显存用起来 不求n卡的速度 起码能用就是胜利 一分钱一分货 能用就行

    LLM讨论区

  • 關於去馬賽克
    bingqin wangB bingqin wang

    对了 有个老牌子JavPlayer 也可以试试 我也好奇这个和Lada对比怎么样

    随便聊聊

  • 關於去馬賽克
    bingqin wangB bingqin wang

    目前我知道的靠连续扩散算法补充图像的办法应该是可以做到的 但是需要有一个微调的模型 因为本质上不是去掉马赛克 而是在马赛克的基础上进行创作并补齐 所以用本地部署的通用模型 大概率细节上会有些对不上 云端的算力够 但是不知能不能过审

    随便聊聊

  • 分享一下我折腾RAG的不成功经验
    bingqin wangB bingqin wang

    我正好有个开源项目适合大佬的需求 你可以试试 我做了封装 直接安装就能用 知识入网里面有协议 直接用agent自己读协议工作比较省力https://github.com/superalp1985/fame-knowledge-agent-gateway

    LLM讨论区

  • 刚把推理引擎跑到15 token/s,新人发帖想听听大家的意见
    bingqin wangB bingqin wang

    @566656661 果然是专家 确实是非浮点运算 但是比您说的这种更极端 我从数学底层把所有乘除和微分计算都换成了有限加法表达的公式 也就是全面离散数学化 非线性计算用了一部分查表 我的目标是NPU 利用CANN算子做优化 这样有俩个好处1.可以最大避免带宽影响大力出奇迹 2.所有结果计算可审计 相同的seed得到的答案完全一致 比较适合高确定性场景

    LLM讨论区

  • 刚把推理引擎跑到15 token/s,新人发帖想听听大家的意见
    bingqin wangB bingqin wang

    @terry 感谢老大 你的视频对我帮助也很大 少踩了不少坑 你太谦虚了

    LLM讨论区

  • 刚把推理引擎跑到15 token/s,新人发帖想听听大家的意见
    bingqin wangB bingqin wang

    大家好,第一次在论坛发帖,有点紧张,有什么不对的地方请大家多包涵。

    我一直对LLM推理很感兴趣,自己动手写了一个极简的推理引擎。因为对数值计算有点执念,我走了一条比较偏门的路子——尽可能把浮点运算都换成整数和定点数(像Q8.8/Q16这种),想看看在纯CPU上能跑成什么样。

    折腾了一段时间,目前的情况是这样的:

    速度:在我的台式机CPU上,2B大小的模型能稳定跑到 15+ token/s,最低也在10以上

    确定性:因为全是整数运算,我做了Trace Hash校验,结果是一致的

    语义:简单对比过,和浮点版本的输出差异不大,没有明显崩坏

    我知道这个速度不算惊艳,毕竟只是个2B小模型,而且CPU跑大模型本来就不现实。但我自己觉得这条路好像可以继续往下走——接下来想试试27B的模型,还有昇腾那边的NPU,也在关注Tenstorrent,感觉他们的分层计算思路和我的方向有点契合。

    我发这个帖子,主要是想请大家帮我看看:

    这种“全部用整数算”的方向,你们觉得有实际落地的价值吗?还是说只是我个人的玩具?

    如果我想往NPU上移植,有没有什么是你们觉得最该提前注意的坑?

    论坛里有没有同样在搞推理引擎的朋友,想交个朋友,互相学习一下

    代码还很糙,暂时没好意思发出来,等再打磨一下我再开源吧,目前有个验证版的开源https://github.com/superalp1985/DCA-Inference-Engine。谢谢大家看完,希望没占用你们太多时间。

    LLM讨论区
  • 登录

  • 没有帐号? 注册

  • 登录或注册以进行搜索。
  • 第一个帖子
    最后一个帖子
0
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组