/home/lll/llama.cpp/build/bin/llama-server -m /home/lll/models/iq4xs/Qwen3.8-27B-IQ4_XS.gguf --mmproj /home/lll/models/iq4xs/mmproj-Qwen3.8-27B-f16.gguf --spec-type draft-mtp --spec-draft-model /home/lll/models/mtp-Qwen3.8-27B-Q4_0.gguf --spec-draft-n-max 2 -c 262144 -ngl 99 -ctk q8_0 -ctv q8_0 --port 8080 今天换到这个模型了,kvcache可以用q8。速度也快了一点点。41点多。 hermes chat里面本地聊天,还是比较跟手的,等待时间不算长。对了,思考换成low了。如果在电报里面用,感觉等得要久。不知道这个卡想要速度上到50以上有没有可能性。这个r9700, 在256K上下文前提下,质量和速度综合最好的27b量化模型,有大虾推荐吗?