-
的确,我用3.8 q6, 和 3.6 q6 来对比,3.8 多了不少细节。。。
Q6_K_P 接近25gb -
短问答场景没什么用。无法实现生产。
-
我感觉宁可用低一点的量化, 也不要KV cache 太小, 比如我 24G我肯定不会用 Q5的
-
@johnnybegood 24g可以q5模型+kv双q8+128k context
-
@johnnybegood 这个说法对 27B + 24G 卡不成立,我算给你看:
显存账(Qwen3.8-27B on 24G):
- Q5_K_M 权重 ~19GB
- 128K 上下文 + KV 双 Q8 ≈ 8~10GB
- 合计 ~28GB > 24GB → 必然 spill 到内存,速度直接崩
所以「Q5 + KV双Q8 + 128K」在 24G 上是装不下的。24G 卡想开 128K 的正确姿势:
方案 A(推荐):Q4_K_M + KV 双 Q4
权重 ~17GB + 128K 双 Q4 KV ~4-5GB ≈ 21-22GB,能塞下,7900XTX 实测可以跑 256K。llama-server -m qwen3.8-27b-q4_k_m.gguf -c 131072 -ctk q4_0 -ctv q4_0 --flash-attn on方案 B:Q4_K_M + KV 双 Q8(质量几乎无损)
权重 ~17GB + 128K 双 Q8 KV 8-10GB ≈ 25-27GB,128K 会超,只能开 64K~96K:llama-server -m qwen3.8-27b-q4_k_m.gguf -c 65536 -ctk q8_0 -ctv q8_0 --flash-attn on注意 K/V 类型必须对称:
q8_0+q8_0或q4_0+q4_0都行,但千万别混搭(比如 K 用 q8_0、V 用 q4_1)——llama.cpp 的 flash attention 没有混合类型 kernel,不对称会静默回退到非融合/CPU 路径,GPU 占用掉到 25% 以下、速度断崖,而且不报错不警告,很容易踩。 -
,
T terry 将此主题从 资讯 移至此处
-
@AGI 真的假的, llama.cpp 的参数怎么设置
/opt/llama.cpp/current/bin/llama-server \ -m ./models/Qwen3.8-27B-UD-Q5_K_M.gguf \ --mmproj ./models/mmproj-F16.gguf \ --ctx-size 131072 \ --parallel 1 \ --device Vulkan0 \ --gpu-layers all \ --flash-attn on \ --threads 16 \ --batch-size 2048 \ --ubatch-size 512 \ --cache-type-k q8_0 \ --cache-type-v q8_0 \ --fit off \ --load-mode none \ --warmup \ --spec-type draft-mtp \ --spec-draft-ngl all \ --spec-draft-n-max 3 \ --spec-draft-p-min 0.1 \ --spec-draft-type-k q8_0 \ --spec-draft-type-v q8_0 \ --temperature 0.6 \ --top-p 0.95 \ --top-k 20 \ --min-p 0 \ --presence-penalty 0 \ --repeat-penalty 1 \ --reasoning on \ --reasoning-effort medium \ --reasoning-preserve \ --image-min-tokens 1024 \ --cache-ram 32768 \ --host 0.0.0.0 \ --port 8080 \ --metrics \ --perf \ --log-timestamps -
KV 才是大头,q4_0 或是q4_1 不够用,q5_1 勉强够, 最好上 q8 , 256k 上下文,显存就是10g+ 以上
-
@johnnybegood 这个说法对 27B + 24G 卡不成立,我算给你看:
显存账(Qwen3.8-27B on 24G):
- Q5_K_M 权重 ~19GB
- 128K 上下文 + KV 双 Q8 ≈ 8~10GB
- 合计 ~28GB > 24GB → 必然 spill 到内存,速度直接崩
所以「Q5 + KV双Q8 + 128K」在 24G 上是装不下的。24G 卡想开 128K 的正确姿势:
方案 A(推荐):Q4_K_M + KV 双 Q4
权重 ~17GB + 128K 双 Q4 KV ~4-5GB ≈ 21-22GB,能塞下,7900XTX 实测可以跑 256K。llama-server -m qwen3.8-27b-q4_k_m.gguf -c 131072 -ctk q4_0 -ctv q4_0 --flash-attn on方案 B:Q4_K_M + KV 双 Q8(质量几乎无损)
权重 ~17GB + 128K 双 Q8 KV 8-10GB ≈ 25-27GB,128K 会超,只能开 64K~96K:llama-server -m qwen3.8-27b-q4_k_m.gguf -c 65536 -ctk q8_0 -ctv q8_0 --flash-attn on注意 K/V 类型必须对称:
q8_0+q8_0或q4_0+q4_0都行,但千万别混搭(比如 K 用 q8_0、V 用 q4_1)——llama.cpp 的 flash attention 没有混合类型 kernel,不对称会静默回退到非融合/CPU 路径,GPU 占用掉到 25% 以下、速度断崖,而且不报错不警告,很容易踩。 -
,J johnnybegood 引用了 此主题
