跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(不使用皮肤)
  • 不使用皮肤
折叠
品牌标识

抡锤者

  1. 主页
  2. LLM讨论区
  3. 3090 24G 单卡,测试一个很新奇的13GB 高质量 Q2K 量化模型

3090 24G 单卡,测试一个很新奇的13GB 高质量 Q2K 量化模型

已定时 已固定 已锁定 已移动 LLM讨论区
rtx3090
4 帖子 1 发布者 149 浏览
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • S 离线
    S 离线
    stxpnet
    技术大牛 劳动模范
    发表于 最后由 stxpnet 编辑
    #1

    包含部分AI生成 内容,如有违规请大神通知一下,我整改。【最终评论在文末,建议删除此模型】
    7d000072-8024-4efb-a75e-51fdce7ff898-image.jpeg 权重12.9GB,但是没有MTP

    da9dadc2-560e-4f84-9eb9-ef700872ea1e-image.jpeg
    初识是有个不知道是作者还是粉丝的,直接在noogla的github那里放出评分打擂【老外也玩踢馆?】。
    作者直接亮出了 各种测试评分.

    9217fb17-2697-4363-9c3c-5c23267f3492-image.jpeg

    以下引用千问的解析:

    Qwen3.6-27B-Cerebellum-GGUF 在仅有 12 GB 的极小体积下(对于 27B 参数模型而言,平均每个权重仅约 3.8 bits,接近 2-bit 量化级别),却实现了令人惊叹的测试评分,甚至在代码生成任务上“越级”打败了常规的高精度量化模型。
    它之所以能做到“小体积、高性能”,核心在于其独创的 Cerebellum(小脑)量化技术。以下是对其模型卡的深度解析:
    一、 核心黑科技:什么是 Cerebellum 量化?
    传统的量化方法(如标准的 Q2_K、Q4_K)是“一刀切”的,即对模型中所有的层和张量(Tensor)统一应用相同的精度。这就好比给一个团队所有人发同样大小的鞋子,必然有人穿着挤脚,有人穿着宽松。
    Cerebellum 是一种“基于消融实验的混合精度量化(Ablation-informed mixed-precision quantization)”。它不追求全局统一,而是通过精密的测量,找出模型中真正重要的部分,将宝贵的“比特预算”好钢用在刀刃上。
    其工作流程分为极其严谨的三步:
    1. 消融扫描 (Ablation Sweep):绘制“敏感度图谱”
    作者对模型中的每一个张量进行了单独的“破坏性测试”:将某一个张量强行压碎到最低精度(Q2_K),同时保持其他所有张量不变,然后测量模型困惑度(Perplexity, PPL)的变化。
    通过这种穷举式的单变量测试,作者绘制出了整个模型的敏感度图谱:
    神圣张量 (Sacred):例如第 63 层的 attn_q,一旦降级,PPL 暴增 +0.162,说明它对模型智商至关重要。
    可降级张量 (Demotable):例如第 34 层的 ffn_down,降级后 PPL 反而下降了 -0.095。这说明低精度不仅没伤害它,反而可能起到了去除噪声的正则化作用。
    2. 预算分配 (Budget Allocation):精准投放比特
    在设定了 12 GB 的严格体积目标后,分配器根据上述敏感度图谱进行资源倾斜:
    将最敏感的“神圣张量”提升到极高的精度(Q8_0, Q6_K)。
    将不敏感甚至“降级反而更好”的张量死死按在最低精度(Q2_K)。
    通过这种劫富济贫式的分配,在总比特数不变(体积不增加)的前提下,大幅提升了模型的有效智商。
    3. 构建 (Build):逐张量覆盖
    最终使用 llama-quantize 的 --tensor-type 参数,为 64 层模型中的 181 个关键张量 单独指定了量化精度,生成了最终的混合精度 GGUF 文件。
    二、 模型内部的“贫富差距”:关键发现
    通过 Cerebellum 的扫描,作者揭示了 Qwen3.6-27B 内部极其有趣的结构特性:
    最后一层是“阿喀琉斯之踵”:第 63 层(最后一层)的 q_proj 和 ffn_down 是全模型最敏感的张量,必须给予最高精度(Q8_0)保护。
    存在“负优化”空间:有 7 个张量 在 Q2_K 下表现反而更好。Cerebellum 毫不客气地将它们降级,从而省出了宝贵的比特预算给其他层。
    同层破坏性交互:如果同一层中的两个 FFN 张量同时被降级,会导致比预期更严重的性能崩塌(交互比率 0.13)。这说明量化不能只看单个张量,还要考虑同层内的协同效应。
    最终的精度分布:在 181 个被特殊处理的张量中,Q8_0 有 7 个,Q6_K 有 41 个,Q5_K 有 70 个……而 Q2_K 有 22 个。这种极端的混合精度分布,是它能在 12GB 体积下保持高性能的物理基础。
    

    0933021c-8638-4036-92ab-5dc1f1758f3f-image.jpeg

    这个模型估计是无法MTP了,要是能MTP,那不得起飞?我马上下载来体验几天 (这几天 有TOKEN PLAN快到期了,没有时间详细把玩LLM) ,保险起见开思考模式,思考预算给3072 tokens.
    我只做文学测试 还 有中国象棋编程测试。 开的是131K上下文, 起手速度在40T/S左右 :
    ef5f005f-4017-49c9-a40d-8db9604f6594-image.jpeg
    跑完这个,显存占用在21.45GB. 产生了5078 TOKENS,它抽到的是红楼梦第三回。 看着格式,感觉质量尚可。但是给KIMI评测之后大跌眼镜。只有33分 【此处我怀疑是KIMI评测试卷过多之后,造成它的上下文爆炸了,毕竟资本家给免费用户 的不可能是什么 好模型和大显卡】
    a95a366f-3536-4aaf-bd23-ce6a151714d9-image.jpeg

    显存感觉还不会爆,用TRAE赌一把中国象棋吧。结果直接就 完成了。感觉是聊天模板不对,又或者是llama.cpp探测到OOM风险,直接拒绝回答?
    只能重新加载了,加载前看了显卡账本。
    common_memory_breakdown_print: | memory breakdown [MiB] | total free self model context compute unaccounted |
    common_memory_breakdown_print: | - CUDA0 (RTX 3090) | 24124 = 2591 + (21193 = 11862 + 8341 + 990) + 338 |
    common_memory_breakdown_print: | - Host | 949 = 397 + 0 + 552 |

    恰好只剩余338MB?

    不管它,修改一下思考成本为4096 token,清空代码文件夹,防止trae抄袭。
    下面就 看它俩表演,看起来 是有40 token/s

    prompt eval time =   15601.74 ms / 16961 tokens (    0.92 ms per token,  1087.12 tokens per second)
           eval time =   14122.43 ms /   530 tokens (   26.65 ms per token,    37.53 tokens per second)
    

    5bfaba73-bfdf-4dba-b549-a8ac636a3484-image.jpeg

    1 条回复 最后回复
    1
    • S 离线
      S 离线
      stxpnet
      技术大牛 劳动模范
      发表于 最后由 编辑
      #2

      整体跑起来比较顺,但满载时显卡温度比我之前测过的模型都要高4-5度吧。
      GPU/显存的占用曲线是比较对齐的(在本人的理论中,这二者越平齐,表示它俩配合得越好,可能产生的 质量/速度 越均衡)
      ffd5f537-7e9d-472a-8bd4-f56c9e418efc-image.jpeg

      1 条回复 最后回复
      0
      • S 离线
        S 离线
        stxpnet
        技术大牛 劳动模范
        发表于 最后由 编辑
        #3

        ebbe3604-6cfc-4347-9b80-9b015f7d24ee-image.jpeg 千问的 试卷评分也出来了,我想它的文学质量肯定有大问题。感觉是削弱了文学记忆,但是增强了推理能力。

        1 条回复 最后回复
        0
        • S 离线
          S 离线
          stxpnet
          技术大牛 劳动模范
          发表于 最后由 编辑
          #4

          最终按作者页面的代码,直接关闭思考,再跑一次以前跑了很多次的俄罗斯方块,下落一个方块后,音频卡死报错。
          然后再跑了一次文学测试 ,出题直接连原文和白话文都没出,挑战失败!
          最后定论:该模型速度较均衡,但文学质量低, 写程序无逻辑(开思考,会导致思考链被截断)多步规划出错。
          关闭思考,感觉它注意力散乱,导致修改了 两次最终也是报错!

          1 条回复 最后回复
          0
          • terryT terry 于 将此主题固定
          • 系统 于 取消固定此主题

          你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

          厌倦了每次访问都刷到同样的帖子?您注册账号后,您每次返回时都能精准定位到您上次浏览的位置,并可选择接收新回复通知(通过邮件或推送通知)。您还能收藏书签、为帖子顶,向社区成员表达您的欣赏。

          有了你的建议,这篇帖子会更精彩哦 💗

          注册 登录
          回复
          • 在新帖中回复
          登录后回复
          • 从旧到新
          • 从新到旧
          • 最多赞同


          • 登录

          • 没有帐号? 注册

          • 登录或注册以进行搜索。
          • 第一个帖子
            最后一个帖子
          0
          • 版块
          • 最新
          • 标签
          • 热门
          • 用户
          • 群组