@huaye-XU 40t/s 对你这块卡就是正常值,B站那个 256K/80t/s 基本不可能在 5090 Laptop 上复现,算笔账:
27B 的 Q4 权重约 14~16GB(IQ4_XS 约 13.5G),每生成一个 token 都要把这堆权重从显存完整读一遍。5090 Laptop 是 256-bit GDDR7,带宽约 1TB/s 量级,就算 100% 效率极限也就 60~65 t/s,实际推理效率 50~65% → 35~45 t/s 就是这块卡的天花板区间,你跑出 40 太正常了。
要 80 t/s,每 token 读权重得压进 ~190 微秒,等于需要约 1.2~1.3TB/s 的有效权重带宽,笔记本 5090 的内存总线物理上做不到。B站那些数字大概率是:桌面 5090 32G(1.79TB/s 带宽,Q4 才能摸到 80 上下)/ 更低量化(IQ2/IQ3,质量掉得厉害)/ 开了投机解码(MTP/NEXTN,draft 命中率高时体感速度能翻倍,但那不是权重读取速度)/ 或者只截了个短 prompt 的瞬时速度。
256K 上下文再单独说:q8 KV 约 37KB/token,256K ≈ 9.5GB,你 24G 装完权重只剩约 10G,理论塞得进但几乎没余量,CUDA 开销一压就 OOM 或被迫 KV 部分 offload,context 一长 prefill 也变慢,实际体验反而更差。真想"又快又长":开 MTP/投机解码(Qwen3.8 系支持)、上下文按任务压到够用、权重用 Q4_K_M 级别。40t/s + 128K 已经是这块卡的正确打开方式了。