测了一下Tenary Bonsai 27B,55 tok/s,工具调用 不太理想 我愿称之为16G+显卡 价值检测器。
-
最近在HF社区还是挺火的

下载前想着是穷人 的解药,是不是能让 20G显存实现27B 90%的性能和智商?
下载后一测,个人认为和QWEN 3.6 9B一个水平,应该还是欠缺优化,无法恢复原始模型的行为和精度。
16G+带tensor core的显卡应该都可以玩,在占用满90%-95%显卡的情况下,如果模型能正常跑。
速度如果是 x tokens /s
那么你的显卡价值 = RTX3090 24G的市场价 / 55 * x。我用的是168K上下文,双F16 K V缓存。
简单的问题都是失败,我已经按官方推荐设置温度0.7,开启思考模式。
全程速度都非常稳, 55T/s。一句话的俄罗斯方块,无法运行。
带提示词的俄罗斯。


完成度还行吧。 这个俄罗斯的消行 火花挺好看的。 但是最后一行经常有残影,很难看。一句话的坦克大战,跑了4分钟,最后无法运行。
最后再测一下evalbench吧:

时间太长了(开了思考的),分数也不算高,全参数,262K上下文并没有实用性。 SHIFT+DELETE是它最后的归宿。 -
问题我给它加了那个不错的模板啊,理论上应该不会这么差才对。 按它这个三进制东东,Q2,也就是3的2次方,是9bit KV缓存吧? . 然后比起常规Q4的8.5BPW KV缓存还要高一点吧? 不知道48G 4090显卡的大神们,你们跑QWEN 27B的真实体验是怎样呢?
權重跟KV Cache的BPW是兩件事阿, 模型權重精度過低基本上Cache精度多高也沒用
模板 (如果我沒理解錯意思應該是Chat template)只是提供了呼叫工具的架構
沒記錯Tenary Bonsai的27B量化已經把模型權重精度壓到1.2還是1.3 BPW, 這個基本上應該等於IQ1的程度了
就連單純壓縮 (W4A4的NVFP4) 的4.2x的BPW和混合壓縮 (NVFP4 + FP16, 我自己在用的PrimsaSCOUT) 的5.3 BPW在呼叫Tool Call的時候也偶爾遇到問題, 不覺得IQ1會好到哪裏去
Llama.cpp在真實情況下基本上都是推薦最低Q4或者IQ3 XS (IQ3採用混合壓縮所以應該在3.3 BPW左右)
甚至Reddit在編程上直接推薦FP8起跳
-
-
不是,它是三进制,三进制的Q2和普通二进制还是有所区别的.
反正我测试下来它比我下载 的那个5.0BPW的双Q8 40T/S的智商 要低一点,速度快了15tokens /s .
普通的Q2K也无法达到它的智商密度吧。
况且我用的是双F16 K /V CACHE,个人理解: 它的K V CACHE密度至少在Q6-Q8左右,权重真实密度至少Q6,否则它根本不可能写出俄罗斯方块,也不可能跑了86分的 tool-eval分数。 我的经验是权重原始真实密度和KV CACHE 量化等级相差过大,要么发疯乱写,要么直接聊不了几句。
我知道他是三進制, 所以我才單純拿BPW來作解釋, 沒單純說是二進制
而且我也說錯了一點, Tenary Bonsai的BPW是1.7, 普通Bonsai才是1.2 BPW, 不過1.7 BPW其實也在IQ1_XXS附近 (1.6 BPW), IQ2_XXS已經是2.xBPW了
Q6 K Quant大約在6.6 BPW了
不論模型怎麼量化, 模型的基本面知識在27B跟9B對比下永遠都是27B優勝, 這個打從模型出世的時候就決定了
而且智商密度不代表Tool Call成功率和用戶對結果的滿意度吧
我在之前也有評測過不同BPW (單純量化跟混合量化) 對於Tool Call的影響
結果就是越低BPW效果越差, 主要都是體現在狀態修正,和遵循結構規範 (Structured Output) 方面, 偏偏這兩個對於Tool Call就是很關鍵的因數
-
量化过低可能导致自回归模型无法预测出某些在 当前硬件水平下本应该可以预测出来的词汇,连接不上,而模板里面明确有这些句子引导模型的行为,模型直接忽略了,导致工具调用失败。 我尝试过去修正,有可能解决掉分的那两道题 ,但是又会导致别的题掉分更多,得不偿失。 大神们制作 模板时候应该是用F16模型 + 大容量显卡制作的,质量好很多。