@exllm @terry
根据楼主的测试了一下
cpu: AMD Ryzen 5 7500F
RAM:DDR5 32GB 6000
GPU: 7900XTX
OS: Ubuntu 24.04
软件 : llama.cpp + vulkan
先说结果:

llama.cpp运行参数,spec-draft-n-max 3 速度最好:
~/llama_vulkan/bin/llama-server \
-m ~/models/Qwen3.8-27B-Q5_K_M.gguf \
-t 10 \
-b 512 \
-ub 256 \
--spec-draft-n-max 3 \
--fit off \
--no-context-shift \
--metrics \
--kv-unified \
--jinja \
--cache-type-k q8_0 \
--cache-type-v q8_0 \
-fa on \
--spec-type draft-mtp \
--ctx-size 131072 \
--parallel 1 \
-ngl -1 \
--host 0.0.0.0 \
--port 8080 \
--chat-template-kwargs '{"enable_thinking":true,"preserve_think":false,"reasoning_effort":"medium"}' \
--no-mmap \
--temp 0.6 \
--top-p 0.5 \
--top-k 15 \
--repeat-penalty 1.0 \
--alias qwen3.8-27b-q5
llama.cpp运行参数,spec-draft-n-max 2 :

llama.cpp运行参数,spec-draft-n-max 4 :

总结:
| 参数 | Prompt速度 | 生成速度 | 平均延迟 | MTP命中率 |
|---|---|---|---|---|
| n=2 | 288.73 t/s | 68.14 t/s | 17.436 s | 87.62% |
| n=3 | 286.60 t/s | 71.74 t/s | 16.772 s | 82.50% |
| n=4 | 249.53 t/s | 47.96 t/s | 24.911 s | 74.99% |
这台电脑n=3最好。
注:修改这个参数是MTP speculative decoding(推测解码)一次最多提前“猜”多少个 token。