新版llama.cpp 更新测试(b9602 )
-
| 项目 | 旧版本 | 新版本 | |-----------|-----------------|-------------------| | llama.cpp | b9556 (19bba67) | b9602 (1593d5684) | | ggml | 0.14.0 | 0.15.0 | | CUDA | 12.8 | 12.8 (arch 120a) |变更亮点
- CUDA 数据竞争修复(Mamba SSM scan)
- Server slot/KV cache 修复
- MTP 性能优化(减少 D2D 拷贝)
- 视频/ViT 批处理支持等新功能测试条件完全相同:Qwen3.6-27B-Q4_K_M, -ngl 50 -c 98304 -b 1024 -fa on
Prefill / TTFT场景: 💬 短对话 Prompt tok: 63 b9556 (旧): TTFT 0.42s / 150 tok/s b9602 (新): 0.44s / 144 tok/s 变化: ~±0 噪声 ──────────────────────────────────────── 场景: 📄 长文档 Prompt tok: 704 b9556 (旧): TTFT 0.93s / 758 tok/s b9602 (新): 0.92s / 763 tok/s 变化: ~±0 噪声 ──────────────────────────────────────── 场景: 💻 编程场景 Prompt tok: 532 b9556 (旧): TTFT 0.90s / 589 tok/s b9602 (新): 0.90s / 591 tok/s 变化: ~±0 噪声 Decode | 场景 | b9556 (旧) | b9602 (新) | 变化 | |----------|------------|------------|------| | 短对话 | 12.7 tok/s | 12.7 tok/s | — | | 长文档 | 12.6 tok/s | 12.6 tok/s | — | | 编程场景 | 12.6 tok/s | 12.6 tok/s | — | VRAM | 指标 | b9556 (旧) | b9602 (新) | |------|------------|--------------------| | 已用 | ~15535 MiB | 15359 MiB | | 余量 | ~768 MiB | 944 MiB (+176 MiB) | 结论 性能没有退化,也没有明显提升 — 三次场景的 prefill/decode 差异都在测量误差范围内(<3%)。 VRAM 余量多了约 176 MiB(15359 vs 15535),可能来自 MTP 减少 D2D 拷贝 或 CUDA context 重置修复 的副作用,算是个小惊喜。 这次更新的价值在于 bug fix 安全性和稳定性(CUDA 数据竞争修复、server slot/KV cache 修复),而非性能提升。