找到一個蠻有趣的量化模式, ROCmFP4, 有7000系或者9000系的A卡可以嘗試一下
-
如題, Github鏈接
在研究llama.cpp的MoQ偶然見到, 采用的不是MX格式而且基於4 Bit 權重尋找表 +自定義8 Bit E4M3 (應該可以用RDNA 4?的FP8硬件加速), 基本上就是用4 Bit權重扮演8 Bit
自定義8 Bit E4M3拔掉了Sign Bit, 能從0到61440, 這個已經算是很廣闊的範圍了, 要知道傳統的FP8 E4M3只能到+448到-448, 精度上理論上會比傳統Q4KM有增加
有人在lemonade上跑了HumanEval+評測, 這東東追得上27B Q8, 變相來説用Q4的VRAM用量追上Q8的意思?
-
7系列只有INT4,9系列不知道有没有FP4,FP8应该都支持,存储格式意义不大,FP4部分专程INT4就是了,精度损失很小,重要的是推理精度,现在FP8似乎都不够,DeepSeek V4似乎是FP8推理,但又太大。