AGI 谢谢回复,其实还可以加--spec-draft-type-k q4_0 --spec-draft-type-v q4_0,这样可以更省一步显存,另外日常任务多用分身去完成,主体只获取子agent的答案,这样上下文消耗速度明显降低
。
gslzk
@gslzk
-
單張 RX 7900 XTX 24GB Qwen3.8-27B 優化紀錄 —— Vulkan 路線實測報告 -
單張 RX 7900 XTX 24GB Qwen3.8-27B 優化紀錄 —— Vulkan 路線實測報告可以加--no-mmproj-offload,让cpu计算图片,又可以省一些显存出来,而且速度不慢,适合读图不多的工作环境。
另外我加载了--chat-template-file D:\models\Qwen3.8-27B-GGUF\chat_template.jinja,可以让思考变少一些