跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 AI 广场
陈鸿陈

陈鸿

@陈鸿
取消关注 关注
关于
帖子
14
主题
1
分享
0
群组
0
粉丝
0
关注
1

帖子

最新 最佳 有争议的

  • 换了好几个模型,有些简单问题AI就是很难回答上来
    陈鸿陈 陈鸿

    需要你自己补充问题的边界。

    LLM讨论区 本地模型

  • 7900XTX + llama.cpp Qwen3.6 27B TurboQuant + MTP 测试结果分享
    陈鸿陈 陈鸿

    我是用hermes 接入 deepseek flash ,然后帮我做的。 目前机器先配置好了出国的代理。在ubuntu下。
    折腾了两个末模型。

    ╭─ ⚕ Hermes ─────────────────────────────────────────────────────────────────────────────────────────────────────╮
    以下是两个模型的完整对比:

    模型一:Heretic v2(hmenu #4)
    
    文件: Qwen3.6-27B-uncensored-heretic-v2-Native-MTP-Preserved-Q4_K_M.gguf
    大小: 17 GB
    规格: Q4_K_M 量化
    
    | 参数            | 值                  |
    |-----------------|---------------------|
    | 架构            | qwen35              |
    | 层数            | 65                  |
    | Attention heads | 24                  |
    | KV heads (GQA)  | 4                   |
    | KV 维度         | 256 per head        |
    | 最大上下文      | 262,144(256K)     |
    | 混合注意力      | 每 4 层一次全注意   |
    | MTP             | 有,Native 原生保留 |
    
    当前配置:
    - KV cache:f16(2 bytes per value)
    - 上下文:94K(-c 94208)
    - 实测速度:60+ t/s(MTP 有效加速)
    
    优点: MTP 原生完好,接受率高 → 速度快 2 倍,越狱有效
    缺点: f16 KV cache 体积大(每 token ~580 KB),94K 上下文已吃满 99% VRAM,无法再扩大
    
    
    
    模型二:Fable 711(hmenu #11,当前运行中)
    
    文件: Qwen3.6-27B-Fable-Fus-711-UnHeretic-NM-DAU-NEO-MAX-NEO-MTP-Q4_K_M.gguf
    大小: 18 GB
    规格: Q4_K_M 量化
    
    | 参数            | 值                               |
    |-----------------|----------------------------------|
    | 架构            | qwen35                           |
    | 层数            | 65                               |
    | Attention heads | 24                               |
    | KV heads (GQA)  | 4                                |
    | KV 维度         | 256 per head                     |
    | 最大上下文      | 262,144(256K)                  |
    | 混合注意力      | 每 4 层一次全注意                |
    | MTP             | 标称有,实为残废(16.7% 接受率) |
    
    当前配置:
    - KV cache:q4_0(0.5 bytes per value,省 4 倍)
    - 上下文:180K(-c 184320)
    - 实测速度:31 t/s(MTP 几乎无效,纯裸推理)
    
    优点: q4_0 KV cache 省 4 倍空间,可跑 180K 大上下文,VRAM 仅 88%
    缺点: 7 模型 Fusion merge 洗掉了 MTP 头和越狱能力,速度只有 Heretic 的一半,且无法越狱
    
    
    
    KV Cache 类型对比
    
    | KV cache 类型 | bytes/值 | 体积比 | 精度 | 适用场景            |
    |---------------|----------|--------|------|---------------------|
    | f16           | 2.0      | 1x     | 高   | 追求精度,短上下文  |
    | q4_0          | 0.5      | 1/4    | 中低 | 大上下文,VRAM 有限 |
    
    按当前 65 层 + KV 256 per head + 4 KV heads + 混合注意力架构计算:
    
    | 上下文              | f16 KV cache                  | q4_0 KV cache          |
    |---------------------|-------------------------------|------------------------|
    | 32K                 | ~19 GB                        | ~4.7 GB                |
    | 94K(Heretic 当前) | ~55 GB → VRAM 99%,大量 spill | —                      |
    | 180K(Fable 当前)  | ~105 GB → 不可能              | ~11.6 GB → 88% VRAM ✅ |
    
    
    
    总对比表
    
    | 项目 | Heretic v2 (#4) | Fable 711 (#11) |
    |------|:-:|:-:|
    | 文件大小 | 17 GB | 18 GB |
    | 模型来源 | 原生微调 | 7 模型 Fusion 合并 |
    | MTP | ✅ 原生保留,60%+ 接受率 | ❌ Merge 损坏,16.7% 接受率 |
    | 越狱/破解 | ✅ 有效 | ❌ "UnHeretic" 已反向合并 |
    | 速度 | 60+ t/s | 31 t/s |
    | KV cache | f16(大但精度高) | q4_0(小但省 4 倍) |
    | 当前上下文 | 94K(VRAM 极限) | 180K(还有余量) |
    | 显存占用 | 99%(24.7 GB) | 88%(21.1 GB) |
    | 余量 | 几乎没有 | ~3.9 GB 可用于 KV cache 增长 |
    
    一句话总结: Heretic 胜在速度和越狱,但 VRAM 已到极限;Fable 胜在上下文大且有余量,但 MTP 和越狱都被 merge 毁了。两者的取舍就是 速度快/越狱 vs 上下文大。
    
    LLM讨论区 7900xtx mtp llama.cpp
  • 登录

  • 登录或注册以进行搜索。
  • 第一个帖子
    最后一个帖子
0
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组