-
,
T terry 将此主题从 随便聊聊 移至此处
-
整數運算? 是指非FP形式的GEMM嗎? INT8的W8A8或者INT4的W4A4?
如果是用來適配舊顯卡/NPU這個思路不是不行
但是目前的新顯卡大方向是FP低精度運算, 可能聚焦在NPU比較好? 目前大多數NPU的用法也是NPU Prefill + GPU Decode
AMD XDNA系列跟Intel的NPU系列
Intel的爛命名, 沒有架構名字, 只叫NPU然後加個數字, Arrow Lake (Ultra 200)用NPU 3720, Panther Lake (Ultra 300)用NPU 5
-
整數運算? 是指非FP形式的GEMM嗎? INT8的W8A8或者INT4的W4A4?
如果是用來適配舊顯卡/NPU這個思路不是不行
但是目前的新顯卡大方向是FP低精度運算, 可能聚焦在NPU比較好? 目前大多數NPU的用法也是NPU Prefill + GPU Decode
AMD XDNA系列跟Intel的NPU系列
Intel的爛命名, 沒有架構名字, 只叫NPU然後加個數字, Arrow Lake (Ultra 200)用NPU 3720, Panther Lake (Ultra 300)用NPU 5
@566656661 果然是专家 确实是非浮点运算 但是比您说的这种更极端 我从数学底层把所有乘除和微分计算都换成了有限加法表达的公式 也就是全面离散数学化 非线性计算用了一部分查表 我的目标是NPU 利用CANN算子做优化 这样有俩个好处1.可以最大避免带宽影响大力出奇迹 2.所有结果计算可审计 相同的seed得到的答案完全一致 比较适合高确定性场景
-
@566656661 果然是专家 确实是非浮点运算 但是比您说的这种更极端 我从数学底层把所有乘除和微分计算都换成了有限加法表达的公式 也就是全面离散数学化 非线性计算用了一部分查表 我的目标是NPU 利用CANN算子做优化 这样有俩个好处1.可以最大避免带宽影响大力出奇迹 2.所有结果计算可审计 相同的seed得到的答案完全一致 比较适合高确定性场景
-
@566656661 CANN社区他们内部开发人员都吐槽 别提了 但是没钱买显卡 这是硬伤
-
不求能追上CUDA 只要大概能跑 没有过于忍不了的延迟就行 特别是国内单位 现在都必须全国产 所以这问题早晚得解决
-
,
T terry 将此主题从 Mark专区 移至此处


