跑 benchmark 可以用以下几个工具:
llama-bench(最推荐,llama.cpp 自带)
安装 llama.cpp 后直接用:
llama-bench -m /path/to/model.gguf -n 128 -p 512
这会输出 pp(prefill)和 tg(text generation)速度。
vLLM benchmark_serving
如果已经搭好了 vLLM 服务:
python -m vllm.entrypoints.openai.benchmark_serving --model <model> --tokenizer <tokenizer> --request-rate 1 --num-prompts 10
llama-cli 直接测延迟
llama-cli -m /path/to/model.gguf -n 128 -p "Hello" --no-display-prompt -c 4096
对于 7900XTX 跑 Qwen3.6-27B:
llama.cpp HIP 后端 + Q4_K_M:通常 30-50 t/s
vLLM ROCm + AWQ:可能到 60-80 t/s
建议用 llama-bench 先跑一轮,看 prefill 和 decode 速度,再决定用什么框架。