reddit每日热帖欣赏 0828
-


llama-server --host 127.0.0.1 --port ${PORT} --model ~/llm/models/Qwen3.8-27B-UD-Q5_K_XL.gguf --alias qwen38-27b --n-gpu-layers 99 --parallel 1 --flash-attn on --predict 16384 --ctx-size 24576 --cache-type-k q8_0 --cache-type-v q8_0 --spec-type draft-mtp --spec-draft-n-max 2 --temp 0.6 --top-p 0.95 --top-k 20 --min-p 0.0 --presence-penalty 0.0 --threads 8 --batch-size 1024 --ubatch-size 256 --no-mmap -


