<?xml version="1.0" encoding="UTF-8"?><rss xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title><![CDATA[3090 24G 单卡,测试一个很新奇的13GB 高质量 Q2K 量化模型]]></title><description><![CDATA[<p dir="auto">包含部分AI生成 内容，如有违规请大神通知一下，我整改。【最终评论在文末，建议删除此模型】<br />
<img src="https://upload.lcz.me/uploads/df8f2d05-8fd7-4b47-8f1f-d8763f6d12b2.jpeg" alt="7d000072-8024-4efb-a75e-51fdce7ff898-image.jpeg" class=" img-fluid img-markdown" />  权重12.9GB,但是没有MTP</p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/74e8e185-17e2-4aa9-bb34-b08cfe485d77.jpeg" alt="da9dadc2-560e-4f84-9eb9-ef700872ea1e-image.jpeg" class=" img-fluid img-markdown" /><br />
初识是有个不知道是作者还是粉丝的，直接在noogla的github那里放出评分打擂【老外也玩踢馆？】。<br />
作者直接亮出了 各种测试评分.</p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/7bdc5142-870a-480f-9b36-ef3e3501d06e.jpeg" alt="9217fb17-2697-4363-9c3c-5c23267f3492-image.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto">以下引用千问的解析:</p>
<pre><code>Qwen3.6-27B-Cerebellum-GGUF 在仅有 12 GB 的极小体积下（对于 27B 参数模型而言，平均每个权重仅约 3.8 bits，接近 2-bit 量化级别），却实现了令人惊叹的测试评分，甚至在代码生成任务上“越级”打败了常规的高精度量化模型。
它之所以能做到“小体积、高性能”，核心在于其独创的 Cerebellum（小脑）量化技术。以下是对其模型卡的深度解析：
一、 核心黑科技：什么是 Cerebellum 量化？
传统的量化方法（如标准的 Q2_K、Q4_K）是“一刀切”的，即对模型中所有的层和张量（Tensor）统一应用相同的精度。这就好比给一个团队所有人发同样大小的鞋子，必然有人穿着挤脚，有人穿着宽松。
Cerebellum 是一种“基于消融实验的混合精度量化（Ablation-informed mixed-precision quantization）”。它不追求全局统一，而是通过精密的测量，找出模型中真正重要的部分，将宝贵的“比特预算”好钢用在刀刃上。
其工作流程分为极其严谨的三步：
1. 消融扫描 (Ablation Sweep)：绘制“敏感度图谱”
作者对模型中的每一个张量进行了单独的“破坏性测试”：将某一个张量强行压碎到最低精度（Q2_K），同时保持其他所有张量不变，然后测量模型困惑度（Perplexity, PPL）的变化。
通过这种穷举式的单变量测试，作者绘制出了整个模型的敏感度图谱：
神圣张量 (Sacred)：例如第 63 层的 attn_q，一旦降级，PPL 暴增 +0.162，说明它对模型智商至关重要。
可降级张量 (Demotable)：例如第 34 层的 ffn_down，降级后 PPL 反而下降了 -0.095。这说明低精度不仅没伤害它，反而可能起到了去除噪声的正则化作用。
2. 预算分配 (Budget Allocation)：精准投放比特
在设定了 12 GB 的严格体积目标后，分配器根据上述敏感度图谱进行资源倾斜：
将最敏感的“神圣张量”提升到极高的精度（Q8_0, Q6_K）。
将不敏感甚至“降级反而更好”的张量死死按在最低精度（Q2_K）。
通过这种劫富济贫式的分配，在总比特数不变（体积不增加）的前提下，大幅提升了模型的有效智商。
3. 构建 (Build)：逐张量覆盖
最终使用 llama-quantize 的 --tensor-type 参数，为 64 层模型中的 181 个关键张量 单独指定了量化精度，生成了最终的混合精度 GGUF 文件。
二、 模型内部的“贫富差距”：关键发现
通过 Cerebellum 的扫描，作者揭示了 Qwen3.6-27B 内部极其有趣的结构特性：
最后一层是“阿喀琉斯之踵”：第 63 层（最后一层）的 q_proj 和 ffn_down 是全模型最敏感的张量，必须给予最高精度（Q8_0）保护。
存在“负优化”空间：有 7 个张量 在 Q2_K 下表现反而更好。Cerebellum 毫不客气地将它们降级，从而省出了宝贵的比特预算给其他层。
同层破坏性交互：如果同一层中的两个 FFN 张量同时被降级，会导致比预期更严重的性能崩塌（交互比率 0.13）。这说明量化不能只看单个张量，还要考虑同层内的协同效应。
最终的精度分布：在 181 个被特殊处理的张量中，Q8_0 有 7 个，Q6_K 有 41 个，Q5_K 有 70 个……而 Q2_K 有 22 个。这种极端的混合精度分布，是它能在 12GB 体积下保持高性能的物理基础。
</code></pre>
<p dir="auto"><img src="https://upload.lcz.me/uploads/fea8a463-66ac-43f7-9bb7-422cde457afe.jpeg" alt="0933021c-8638-4036-92ab-5dc1f1758f3f-image.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto">这个模型估计是无法MTP了,要是能MTP,那不得起飞？我马上下载来体验几天 (这几天 有TOKEN PLAN快到期了,没有时间详细把玩LLM)  ，保险起见开思考模式，思考预算给3072 tokens.<br />
我只做文学测试 还 有中国象棋编程测试。 开的是131K上下文， 起手速度在40T/S左右 ：<br />
<img src="https://upload.lcz.me/uploads/c3d36dc1-b43a-48bf-be24-f6aebd8c3485.jpeg" alt="ef5f005f-4017-49c9-a40d-8db9604f6594-image.jpeg" class=" img-fluid img-markdown" /><br />
跑完这个，显存占用在21.45GB. 产生了5078 TOKENS，它抽到的是红楼梦第三回。 看着格式，感觉质量尚可。但是给KIMI评测之后大跌眼镜。只有33分 【此处我怀疑是KIMI评测试卷过多之后，造成它的上下文爆炸了，毕竟资本家给免费用户 的不可能是什么 好模型和大显卡】<br />
<img src="https://upload.lcz.me/uploads/5df5c854-616b-4c47-988d-eece808bfbab.jpeg" alt="a95a366f-3536-4aaf-bd23-ce6a151714d9-image.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto">显存感觉还不会爆，用TRAE赌一把中国象棋吧。结果直接就 完成了。感觉是聊天模板不对，又或者是llama.cpp探测到OOM风险，直接拒绝回答？<br />
只能重新加载了，加载前看了显卡账本。<br />
common_memory_breakdown_print: | memory breakdown [MiB] | total   free     self   model   context   compute    unaccounted |<br />
common_memory_breakdown_print: |   - CUDA0 (RTX 3090)   | 24124 = 2591 + (21193 = 11862 +    8341 +     990) +         338 |<br />
common_memory_breakdown_print: |   - Host               |                   949 =   397 +       0 +     552                |</p>
<p dir="auto">恰好只剩余338MB？</p>
<p dir="auto">不管它，修改一下思考成本为4096 token,清空代码文件夹，防止trae抄袭。<br />
下面就 看它俩表演，看起来 是有40 token/s</p>
<pre><code>prompt eval time =   15601.74 ms / 16961 tokens (    0.92 ms per token,  1087.12 tokens per second)
       eval time =   14122.43 ms /   530 tokens (   26.65 ms per token,    37.53 tokens per second)
</code></pre>
<p dir="auto"><img src="https://upload.lcz.me/uploads/c6d38ad2-57aa-465c-9dfc-339ddd81a950.jpeg" alt="5bfaba73-bfdf-4dba-b549-a8ac636a3484-image.jpeg" class=" img-fluid img-markdown" /></p>
]]></description><link>https://lcz.me/topic/576/3090-24g-单卡-测试一个很新奇的13gb-高质量-q2k-量化模型</link><generator>RSS for Node</generator><lastBuildDate>Sun, 26 Jul 2026 22:16:55 GMT</lastBuildDate><atom:link href="https://lcz.me/topic/576.rss" rel="self" type="application/rss+xml"/><pubDate>Mon, 15 Jun 2026 17:25:09 GMT</pubDate><ttl>60</ttl><item><title><![CDATA[Reply to 3090 24G 单卡,测试一个很新奇的13GB 高质量 Q2K 量化模型 on Mon, 15 Jun 2026 17:56:20 GMT]]></title><description><![CDATA[<p dir="auto">最终按作者页面的代码，直接关闭思考，再跑一次以前跑了很多次的俄罗斯方块，下落一个方块后，音频卡死报错。<br />
然后再跑了一次文学测试 ，出题直接连原文和白话文都没出，挑战失败！<br />
最后定论：该模型速度较均衡，但文学质量低， 写程序无逻辑(开思考，会导致思考链被截断）多步规划出错。<br />
关闭思考，感觉它注意力散乱，导致修改了 两次最终也是报错！</p>
]]></description><link>https://lcz.me/post/6990</link><guid isPermaLink="true">https://lcz.me/post/6990</guid><dc:creator><![CDATA[stxpnet]]></dc:creator><pubDate>Mon, 15 Jun 2026 17:56:20 GMT</pubDate></item><item><title><![CDATA[Reply to 3090 24G 单卡,测试一个很新奇的13GB 高质量 Q2K 量化模型 on Mon, 15 Jun 2026 17:30:53 GMT]]></title><description><![CDATA[<p dir="auto"><img src="https://upload.lcz.me/uploads/fc1baae8-82f7-45f2-8942-a44ce92783be.jpeg" alt="ebbe3604-6cfc-4347-9b80-9b015f7d24ee-image.jpeg" class=" img-fluid img-markdown" /> 千问的 试卷评分也出来了，我想它的文学质量肯定有大问题。感觉是削弱了文学记忆，但是增强了推理能力。</p>
]]></description><link>https://lcz.me/post/6987</link><guid isPermaLink="true">https://lcz.me/post/6987</guid><dc:creator><![CDATA[stxpnet]]></dc:creator><pubDate>Mon, 15 Jun 2026 17:30:53 GMT</pubDate></item><item><title><![CDATA[Reply to 3090 24G 单卡,测试一个很新奇的13GB 高质量 Q2K 量化模型 on Mon, 15 Jun 2026 17:28:49 GMT]]></title><description><![CDATA[<p dir="auto">整体跑起来比较顺，但满载时显卡温度比我之前测过的模型都要高4-5度吧。<br />
GPU/显存的占用曲线是比较对齐的（在本人的理论中，这二者越平齐，表示它俩配合得越好，可能产生的 质量/速度 越均衡）<br />
<img src="https://upload.lcz.me/uploads/a76a5a2e-10ff-421a-accb-e378e785718f.jpeg" alt="ffd5f537-7e9d-472a-8bd4-f56c9e418efc-image.jpeg" class=" img-fluid img-markdown" /></p>
]]></description><link>https://lcz.me/post/6986</link><guid isPermaLink="true">https://lcz.me/post/6986</guid><dc:creator><![CDATA[stxpnet]]></dc:creator><pubDate>Mon, 15 Jun 2026 17:28:49 GMT</pubDate></item></channel></rss>