测了一下Tenary Bonsai 27B,55 tok/s,工具调用 不太理想 我愿称之为16G+显卡 价值检测器。
-
问题我给它加了那个不错的模板啊,理论上应该不会这么差才对。 按它这个三进制东东,Q2,也就是3的2次方,是9bit KV缓存吧? . 然后比起常规Q4的8.5BPW KV缓存还要高一点吧? 不知道48G 4090显卡的大神们,你们跑QWEN 27B的真实体验是怎样呢?
權重跟KV Cache的BPW是兩件事阿, 模型權重精度過低基本上Cache精度多高也沒用
模板 (如果我沒理解錯意思應該是Chat template)只是提供了呼叫工具的架構
沒記錯Tenary Bonsai的27B量化已經把模型權重精度壓到1.2還是1.3 BPW, 這個基本上應該等於IQ1的程度了
就連單純壓縮 (W4A4的NVFP4) 的4.2x的BPW和混合壓縮 (NVFP4 + FP16, 我自己在用的PrimsaSCOUT) 的5.3 BPW在呼叫Tool Call的時候也偶爾遇到問題, 不覺得IQ1會好到哪裏去
Llama.cpp在真實情況下基本上都是推薦最低Q4或者IQ3 XS (IQ3採用混合壓縮所以應該在3.3 BPW左右)
甚至Reddit在編程上直接推薦FP8起跳
-
-
不是,它是三进制,三进制的Q2和普通二进制还是有所区别的.
反正我测试下来它比我下载 的那个5.0BPW的双Q8 40T/S的智商 要低一点,速度快了15tokens /s .
普通的Q2K也无法达到它的智商密度吧。
况且我用的是双F16 K /V CACHE,个人理解: 它的K V CACHE密度至少在Q6-Q8左右,权重真实密度至少Q6,否则它根本不可能写出俄罗斯方块,也不可能跑了86分的 tool-eval分数。 我的经验是权重原始真实密度和KV CACHE 量化等级相差过大,要么发疯乱写,要么直接聊不了几句。
我知道他是三進制, 所以我才單純拿BPW來作解釋, 沒單純說是二進制
而且我也說錯了一點, Tenary Bonsai的BPW是1.7, 普通Bonsai才是1.2 BPW, 不過1.7 BPW其實也在IQ1_XXS附近 (1.6 BPW), IQ2_XXS已經是2.xBPW了
Q6 K Quant大約在6.6 BPW了
不論模型怎麼量化, 模型的基本面知識在27B跟9B對比下永遠都是27B優勝, 這個打從模型出世的時候就決定了
而且智商密度不代表Tool Call成功率和用戶對結果的滿意度吧
我在之前也有評測過不同BPW (單純量化跟混合量化) 對於Tool Call的影響
結果就是越低BPW效果越差, 主要都是體現在狀態修正,和遵循結構規範 (Structured Output) 方面, 偏偏這兩個對於Tool Call就是很關鍵的因數
-
量化过低可能导致自回归模型无法预测出某些在 当前硬件水平下本应该可以预测出来的词汇,连接不上,而模板里面明确有这些句子引导模型的行为,模型直接忽略了,导致工具调用失败。 我尝试过去修正,有可能解决掉分的那两道题 ,但是又会导致别的题掉分更多,得不偿失。 大神们制作 模板时候应该是用F16模型 + 大容量显卡制作的,质量好很多。