我用 5060 ti 16G 跑 Qwen3.8-27B-UD-IQ4_XS (Unsloth Dynamic 3.0),感覺不弱智還挺不錯,試過單次請求使用了64k tokens還沒OOM,Prefill 576 t/s,平均速度有 41 t/s

我用 5060 ti 16G 跑 Qwen3.8-27B-UD-IQ4_XS (Unsloth Dynamic 3.0),感覺不弱智還挺不錯,試過單次請求使用了64k tokens還沒OOM,Prefill 576 t/s,平均速度有 41 t/s

要不試試跑專為16GB VRAM搞出來的Q4 XS版本,能夠完整塞進VRAM裡,犧牲些微智力換取速度,速度應可翻兩三倍吧!
LLM讨论区裡有篇「大模型16G卡的春天」,用Qwen3.6-27B-i1-IQ4_XS.gguf以ik_llama.cpp加载,5060ti單卡能跑50k上下文,速度25-27t/s,你5070ti或許真有機會能到50t/s的速度。
忘記在哪找到的截圖
