我前一阵用过这个https://github.com/lemonade-sdk/llamacpp-rocm ,感觉rocm后端跑的时候prefill有800左右,decode大概40左右,不过我可能还需要再测测
6cccccc
-
# 7900 XTX 跑 Qwen3.8-27B 實測73.4t/s 完整部署與實測指南,claude code opus5協助佈署的,分享給大家 -
Qwen3.8 27B Q5_K_M + 7900xtx + DeepSeek Harness实战平均 52 t/s@laobenxiong 确实,用了你这个q5ks的模型,我的速度终于正常了,也不用关thinking,不知道为什么其他人的q5km可以
-
Qwen3.8 27B Q5_K_M + 7900xtx + DeepSeek Harness实战平均 52 t/s@懒人烘培 嗯,我一会试试,好像开了后,mtp命中率很低
-
Qwen3.8 27B Q5_K_M + 7900xtx + DeepSeek Harness实战平均 52 t/s@exllm 我一会试试
-
Qwen3.8 27B Q5_K_M + 7900xtx + DeepSeek Harness实战平均 52 t/s为啥我的启动参数是这样:
-m "$SELECTED_MODEL" -t 10 -b 512 -ub 256
--spec-draft-n-max 3 --fit off --no-context-shift
--metrics --kv-unified --jinja
--cache-type-k q8_0 --cache-type-v q8_0
-fa on --spec-type draft-mtp
--ctx-size 131072 --parallel 1 -ngl -1
--host 0.0.0.0 --port $LLAMA_PORT
--chat-template-kwargs {"enable_thinking": true, "preserve_think": false, "reasoning_effort": "medium"}
--no-mmap --temp 0.6 --top-p 0.5 --top-k 15 --repeat-penalty 1.0
--alias qwen3.8-27b-q5
仍然速度很低,只有12左右
配置如下
cpu: AMD Ryzen 7 2700 Eight-Core Processor (8核16线程, 3.2GHz)
RAM: 64GB DDR4
GPU: AMD Radeon RX 7900 XTX 24GB (RADV NAVI31)
OS: Ubuntu 26.04 LTS (内核 7.0.0-29-generic)
软件 : llama.cpp Vulkan b10486