把--spec-draft-n-max 2修改为3以后,又测试了下:

128k n-max=3 d120000 Benchmark
LLM Command
llama-server \
-m /root/models/Qwen3.6-27B-Uncensored-HauhauCS-Balanced-MTP-Q4_K_P.gguf \
--mmproj /root/models/mmproj-Qwen3.6-27B-Uncensored-HauhauCS-Aggressive-f16.gguf \
-c 131072 \
--parallel 1 \
-b 2048 \
-ub 256 \
-fa 1 \
-ngl 99 \
-t 22 \
--cache-type-k q8_0 \
--cache-type-v q4_0 \
--spec-type draft-mtp \
--spec-draft-n-max 3 \
--no-mmap \
--temp 1.0 \
--top-p 0.95 \
--top-k 20 \
--host 0.0.0.0 \
--port 8080
Test Command
uvx llama-benchy \
--base-url "http://127.0.0.1:8080/v1" \
--model "Qwen3.6-27B-Uncensored-HauhauCS-Balanced-MTP-Q4_K_P.gguf" \
--tokenizer "Qwen/Qwen3-32B" \
--pp 2048 \
--tg 480 \
--depth 120000 \
--runs 1 \
--latency-mode generation \
--skip-coherence \
--concurrency 1 \
--save-result /root/bench-results/qwen36-27b-llamacpp-amd-rx7900xtx-128k-nmax3-d120000.md \
--format md
Benchmark Result
| test |
t/s |
peak t/s |
ttfr |
est_ppt |
e2e_ttft |
| pp2048 @ d120000 |
353.80 |
|
352493.90 ms |
352253.89 ms |
352493.90 ms |
| tg480 @ d120000 |
35.26 |
48.00 |
|
|
|
Server Timing
prompt eval time = 351710.86 ms / 124629 tokens
prompt speed = 354.35 tokens/s
eval time = 13601.37 ms / 480 tokens
generation speed = 35.29 tokens/s
total time = 365312.23 ms / 125109 tokens
draft acceptance = 0.70961
accepted/generated = 325 / 458
truncated = 0
写代码开始速度能上70+,稳定在50+,很满足了