@Quanta-Magic 主要是群主推荐的蓝宝石白金版,这个要贵些。满载确实没有什么声音,随便造,3年质保!
懒人烘培
@懒人烘培
-
# 7900 XTX 跑 Qwen3.8-27B 實測73.4t/s 完整部署與實測指南,claude code opus5協助佈署的,分享給大家 -
# 7900 XTX 跑 Qwen3.8-27B 實測73.4t/s 完整部署與實測指南,claude code opus5協助佈署的,分享給大家谢谢分享,抄作业,实测效果确实很强,,效果比Qwen3.8-27B-Q5_K_M.gguf快,不错!
-
Qwen3.8 27B Q5_K_M + 7900xtx + DeepSeek Harness实战平均 52 t/s@6cccccc
刚才实际测试了,如果开启Thinking了,速度也只有16,把Thinking Off后,速度我就恢复了70了。注意 -
Qwen3.8 27B Q5_K_M + 7900xtx + DeepSeek Harness实战平均 52 t/s@6cccccc
试试我那参数呢,不应该只有12 -
Qwen3.8 27B Q5_K_M + 7900xtx + DeepSeek Harness实战平均 52 t/s@exllm @terry
根据楼主的测试了一下
cpu: AMD Ryzen 5 7500F
RAM:DDR5 32GB 6000
GPU: 7900XTX
OS: Ubuntu 24.04
软件 : llama.cpp + vulkan先说结果:

llama.cpp运行参数,spec-draft-n-max 3 速度最好:~/llama_vulkan/bin/llama-server \ -m ~/models/Qwen3.8-27B-Q5_K_M.gguf \ -t 10 \ -b 512 \ -ub 256 \ --spec-draft-n-max 3 \ --fit off \ --no-context-shift \ --metrics \ --kv-unified \ --jinja \ --cache-type-k q8_0 \ --cache-type-v q8_0 \ -fa on \ --spec-type draft-mtp \ --ctx-size 131072 \ --parallel 1 \ -ngl -1 \ --host 0.0.0.0 \ --port 8080 \ --chat-template-kwargs '{"enable_thinking":true,"preserve_think":false,"reasoning_effort":"medium"}' \ --no-mmap \ --temp 0.6 \ --top-p 0.5 \ --top-k 15 \ --repeat-penalty 1.0 \ --alias qwen3.8-27b-q5llama.cpp运行参数,spec-draft-n-max 2 :

llama.cpp运行参数,spec-draft-n-max 4 :

总结:
参数 Prompt速度 生成速度 平均延迟 MTP命中率 n=2 288.73 t/s 68.14 t/s 17.436 s 87.62% n=3 286.60 t/s 71.74 t/s 16.772 s 82.50% n=4 249.53 t/s 47.96 t/s 24.911 s 74.99% 这台电脑n=3最好。
注:修改这个参数是MTP speculative decoding(推测解码)一次最多提前“猜”多少个 token。