3090 24G 单卡,测试一个很新奇的13GB 高质量 Q2K 量化模型
-
包含部分AI生成 内容,如有违规请大神通知一下,我整改。【最终评论在文末,建议删除此模型】
权重12.9GB,但是没有MTP
初识是有个不知道是作者还是粉丝的,直接在noogla的github那里放出评分打擂【老外也玩踢馆?】。
作者直接亮出了 各种测试评分.
以下引用千问的解析:
Qwen3.6-27B-Cerebellum-GGUF 在仅有 12 GB 的极小体积下(对于 27B 参数模型而言,平均每个权重仅约 3.8 bits,接近 2-bit 量化级别),却实现了令人惊叹的测试评分,甚至在代码生成任务上“越级”打败了常规的高精度量化模型。 它之所以能做到“小体积、高性能”,核心在于其独创的 Cerebellum(小脑)量化技术。以下是对其模型卡的深度解析: 一、 核心黑科技:什么是 Cerebellum 量化? 传统的量化方法(如标准的 Q2_K、Q4_K)是“一刀切”的,即对模型中所有的层和张量(Tensor)统一应用相同的精度。这就好比给一个团队所有人发同样大小的鞋子,必然有人穿着挤脚,有人穿着宽松。 Cerebellum 是一种“基于消融实验的混合精度量化(Ablation-informed mixed-precision quantization)”。它不追求全局统一,而是通过精密的测量,找出模型中真正重要的部分,将宝贵的“比特预算”好钢用在刀刃上。 其工作流程分为极其严谨的三步: 1. 消融扫描 (Ablation Sweep):绘制“敏感度图谱” 作者对模型中的每一个张量进行了单独的“破坏性测试”:将某一个张量强行压碎到最低精度(Q2_K),同时保持其他所有张量不变,然后测量模型困惑度(Perplexity, PPL)的变化。 通过这种穷举式的单变量测试,作者绘制出了整个模型的敏感度图谱: 神圣张量 (Sacred):例如第 63 层的 attn_q,一旦降级,PPL 暴增 +0.162,说明它对模型智商至关重要。 可降级张量 (Demotable):例如第 34 层的 ffn_down,降级后 PPL 反而下降了 -0.095。这说明低精度不仅没伤害它,反而可能起到了去除噪声的正则化作用。 2. 预算分配 (Budget Allocation):精准投放比特 在设定了 12 GB 的严格体积目标后,分配器根据上述敏感度图谱进行资源倾斜: 将最敏感的“神圣张量”提升到极高的精度(Q8_0, Q6_K)。 将不敏感甚至“降级反而更好”的张量死死按在最低精度(Q2_K)。 通过这种劫富济贫式的分配,在总比特数不变(体积不增加)的前提下,大幅提升了模型的有效智商。 3. 构建 (Build):逐张量覆盖 最终使用 llama-quantize 的 --tensor-type 参数,为 64 层模型中的 181 个关键张量 单独指定了量化精度,生成了最终的混合精度 GGUF 文件。 二、 模型内部的“贫富差距”:关键发现 通过 Cerebellum 的扫描,作者揭示了 Qwen3.6-27B 内部极其有趣的结构特性: 最后一层是“阿喀琉斯之踵”:第 63 层(最后一层)的 q_proj 和 ffn_down 是全模型最敏感的张量,必须给予最高精度(Q8_0)保护。 存在“负优化”空间:有 7 个张量 在 Q2_K 下表现反而更好。Cerebellum 毫不客气地将它们降级,从而省出了宝贵的比特预算给其他层。 同层破坏性交互:如果同一层中的两个 FFN 张量同时被降级,会导致比预期更严重的性能崩塌(交互比率 0.13)。这说明量化不能只看单个张量,还要考虑同层内的协同效应。 最终的精度分布:在 181 个被特殊处理的张量中,Q8_0 有 7 个,Q6_K 有 41 个,Q5_K 有 70 个……而 Q2_K 有 22 个。这种极端的混合精度分布,是它能在 12GB 体积下保持高性能的物理基础。
这个模型估计是无法MTP了,要是能MTP,那不得起飞?我马上下载来体验几天 (这几天 有TOKEN PLAN快到期了,没有时间详细把玩LLM) ,保险起见开思考模式,思考预算给3072 tokens.
我只做文学测试 还 有中国象棋编程测试。 开的是131K上下文, 起手速度在40T/S左右 :

跑完这个,显存占用在21.45GB. 产生了5078 TOKENS,它抽到的是红楼梦第三回。 看着格式,感觉质量尚可。但是给KIMI评测之后大跌眼镜。只有33分 【此处我怀疑是KIMI评测试卷过多之后,造成它的上下文爆炸了,毕竟资本家给免费用户 的不可能是什么 好模型和大显卡】

显存感觉还不会爆,用TRAE赌一把中国象棋吧。结果直接就 完成了。感觉是聊天模板不对,又或者是llama.cpp探测到OOM风险,直接拒绝回答?
只能重新加载了,加载前看了显卡账本。
common_memory_breakdown_print: | memory breakdown [MiB] | total free self model context compute unaccounted |
common_memory_breakdown_print: | - CUDA0 (RTX 3090) | 24124 = 2591 + (21193 = 11862 + 8341 + 990) + 338 |
common_memory_breakdown_print: | - Host | 949 = 397 + 0 + 552 |恰好只剩余338MB?
不管它,修改一下思考成本为4096 token,清空代码文件夹,防止trae抄袭。
下面就 看它俩表演,看起来 是有40 token/sprompt eval time = 15601.74 ms / 16961 tokens ( 0.92 ms per token, 1087.12 tokens per second) eval time = 14122.43 ms / 530 tokens ( 26.65 ms per token, 37.53 tokens per second)
-
T terry 于 将此主题固定
-
系统 于 取消固定此主题

千问的 试卷评分也出来了,我想它的文学质量肯定有大问题。感觉是削弱了文学记忆,但是增强了推理能力。