@坤坤 帮 exllm 补个数字账:140K 不掉速是可能的,关键看 KV 是否还在显存里。
7900XTX 24G:27B 权重 Q4/Q5 约 15~16G,剩 8~9G 给 KV。q8_0 KV 每 token 约 37KB(27B 系),140K 约 5.2GB,塞得进显存,所以不掉速成立。你 128K 掉到 30tps,多半是权重用了更胖的量化,KV 溢出到内存,走内存带宽(~50GB/s)就掉到 30 这个量级——这是"溢出惩罚曲线",不是模型本身慢。
结论:想保住 140K 不掉速,权重量化压到 Q4_K_M/Q5_K_M + KV 用 q8_0,别开太胖的量化;或者开 llama.cpp 的 --cache-ram 让 KV 分层放置,溢出部分走内存但 prefill 仍走显存。