需要你自己补充问题的边界。
陈鸿
@陈鸿
-
换了好几个模型,有些简单问题AI就是很难回答上来 -
7900XTX + llama.cpp Qwen3.6 27B TurboQuant + MTP 测试结果分享我是用hermes 接入 deepseek flash ,然后帮我做的。 目前机器先配置好了出国的代理。在ubuntu下。
折腾了两个末模型。╭─
Hermes ─────────────────────────────────────────────────────────────────────────────────────────────────────╮
以下是两个模型的完整对比:模型一:Heretic v2(hmenu #4) 文件: Qwen3.6-27B-uncensored-heretic-v2-Native-MTP-Preserved-Q4_K_M.gguf 大小: 17 GB 规格: Q4_K_M 量化 | 参数 | 值 | |-----------------|---------------------| | 架构 | qwen35 | | 层数 | 65 | | Attention heads | 24 | | KV heads (GQA) | 4 | | KV 维度 | 256 per head | | 最大上下文 | 262,144(256K) | | 混合注意力 | 每 4 层一次全注意 | | MTP | 有,Native 原生保留 | 当前配置: - KV cache:f16(2 bytes per value) - 上下文:94K(-c 94208) - 实测速度:60+ t/s(MTP 有效加速) 优点: MTP 原生完好,接受率高 → 速度快 2 倍,越狱有效 缺点: f16 KV cache 体积大(每 token ~580 KB),94K 上下文已吃满 99% VRAM,无法再扩大 模型二:Fable 711(hmenu #11,当前运行中) 文件: Qwen3.6-27B-Fable-Fus-711-UnHeretic-NM-DAU-NEO-MAX-NEO-MTP-Q4_K_M.gguf 大小: 18 GB 规格: Q4_K_M 量化 | 参数 | 值 | |-----------------|----------------------------------| | 架构 | qwen35 | | 层数 | 65 | | Attention heads | 24 | | KV heads (GQA) | 4 | | KV 维度 | 256 per head | | 最大上下文 | 262,144(256K) | | 混合注意力 | 每 4 层一次全注意 | | MTP | 标称有,实为残废(16.7% 接受率) | 当前配置: - KV cache:q4_0(0.5 bytes per value,省 4 倍) - 上下文:180K(-c 184320) - 实测速度:31 t/s(MTP 几乎无效,纯裸推理) 优点: q4_0 KV cache 省 4 倍空间,可跑 180K 大上下文,VRAM 仅 88% 缺点: 7 模型 Fusion merge 洗掉了 MTP 头和越狱能力,速度只有 Heretic 的一半,且无法越狱 KV Cache 类型对比 | KV cache 类型 | bytes/值 | 体积比 | 精度 | 适用场景 | |---------------|----------|--------|------|---------------------| | f16 | 2.0 | 1x | 高 | 追求精度,短上下文 | | q4_0 | 0.5 | 1/4 | 中低 | 大上下文,VRAM 有限 | 按当前 65 层 + KV 256 per head + 4 KV heads + 混合注意力架构计算: | 上下文 | f16 KV cache | q4_0 KV cache | |---------------------|-------------------------------|------------------------| | 32K | ~19 GB | ~4.7 GB | | 94K(Heretic 当前) | ~55 GB → VRAM 99%,大量 spill | — | | 180K(Fable 当前) | ~105 GB → 不可能 | ~11.6 GB → 88% VRAM ✅ | 总对比表 | 项目 | Heretic v2 (#4) | Fable 711 (#11) | |------|:-:|:-:| | 文件大小 | 17 GB | 18 GB | | 模型来源 | 原生微调 | 7 模型 Fusion 合并 | | MTP | ✅ 原生保留,60%+ 接受率 | ❌ Merge 损坏,16.7% 接受率 | | 越狱/破解 | ✅ 有效 | ❌ "UnHeretic" 已反向合并 | | 速度 | 60+ t/s | 31 t/s | | KV cache | f16(大但精度高) | q4_0(小但省 4 倍) | | 当前上下文 | 94K(VRAM 极限) | 180K(还有余量) | | 显存占用 | 99%(24.7 GB) | 88%(21.1 GB) | | 余量 | 几乎没有 | ~3.9 GB 可用于 KV cache 增长 | 一句话总结: Heretic 胜在速度和越狱,但 VRAM 已到极限;Fable 胜在上下文大且有余量,但 MTP 和越狱都被 merge 毁了。两者的取舍就是 速度快/越狱 vs 上下文大。