@kop-wang 这个帖子质量很高!感谢
@terry
命令参数如下:
llama-server \
-m ./models/Qwen3.6-27B-Uncensored-HauhauCS-Balanced-MTP-Q5_K_P.gguf \
--mmproj ./models/mmproj-Qwen3.6-27B-Uncensored-HauhauCS-Aggressive-f16.gguf \
-c 131072 \
--parallel 1 \
-b 2048 \
-ub 512 \
-fa 1 \
-ngl 99 \
-t 16 \
--cache-type-k q5_0 \
--cache-type-v q4_1 \
--no-mmap \
--temp 0.4 \
--spec-draft-n-max 3 \
--top-p 0.95 \
--top-k 20 \
--host 0.0.0.0 \
--port 8080
精度提高,默认显存占用降低,上下文提高到了128k,通过了https://lcz.me/post/4295 的测试,答案都正确,上下文还剩余不到点一半。
甜点级别的参数了相当于,后续还会测试。

按照下面这个顺序测试:

@kop-wang 这个帖子质量很高!感谢
@terry
命令参数如下:
llama-server \
-m ./models/Qwen3.6-27B-Uncensored-HauhauCS-Balanced-MTP-Q5_K_P.gguf \
--mmproj ./models/mmproj-Qwen3.6-27B-Uncensored-HauhauCS-Aggressive-f16.gguf \
-c 131072 \
--parallel 1 \
-b 2048 \
-ub 512 \
-fa 1 \
-ngl 99 \
-t 16 \
--spec-type draft-mtp
--cache-type-k q5_0 \
--cache-type-v q4_1 \
--no-mmap \
--temp 0.4 \
--top-p 0.95 \
--top-k 20 \
--host 0.0.0.0 \
--port 8080
精度提高,默认显存占用降低,上下文提高到了128k,通过了https://lcz.me/post/4295 的测试,答案都正确,上下文还剩余不到点一半。
甜点级别的参数了相当于,后续还会测试。

按照下面这个顺序测试:
