
#!/bin/bash
export LD_LIBRARY_PATH=/home/qwe/llama.cpp/build/bin:$LD_LIBRARY_PATH
MODEL=/home/qwe/models/Huihui-Qwen3.6-27B-abliterated-NVFP4-MTP.gguf
PORT=8081
LLAMA_SERVER=/home/qwe/llama.cpp/build/bin/llama-server
exec "$LLAMA_SERVER"
--n-predict 16384
--fit off
--split-mode tensor --tensor-split 1,1
--device CUDA0,CUDA1
-m "$MODEL"
--host 0.0.0.0 --port "$PORT"
-t 0 -ngl 99 -np 1
--no-mmap
--kv-unified --flash-attn on --ctx-size 160000
--spec-type draft-mtp --spec-draft-n-max 2
--repeat-penalty 1.1
--min-p 0.02
--temp 0.6 --top-k 20 --top-p 0.95
7900xtx 32G X99 大概40-50t/s