<?xml version="1.0" encoding="UTF-8"?><rss xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title><![CDATA[新版llama.cpp 更新测试（b9602 ）]]></title><description><![CDATA[<pre><code> | 项目       | 旧版本           | 新版本            |                        
 |-----------|-----------------|-------------------|                        
 | llama.cpp | b9556 (19bba67) | b9602 (1593d5684) |                        
 | ggml      | 0.14.0          | 0.15.0            |                        
 | CUDA      | 12.8            | 12.8 (arch 120a)  |  
</code></pre>
<p dir="auto">变更亮点<br />
- CUDA 数据竞争修复（Mamba SSM scan）<br />
- Server slot/KV cache 修复<br />
- MTP 性能优化（减少 D2D 拷贝）<br />
- 视频/ViT 批处理支持等新功能</p>
<p dir="auto">测试条件完全相同：Qwen3.6-27B-Q4_K_M, -ngl 50 -c 98304 -b 1024 -fa on<br />
Prefill / TTFT</p>
<pre><code> 场景: 💬 短对话                                                            
 Prompt tok: 63                                                             
 b9556 (旧): TTFT 0.42s / 150 tok/s                                         
 b9602 (新): 0.44s / 144 tok/s                                              
 变化: ~±0 噪声                                                             
 ────────────────────────────────────────                                   
 场景: 📄 长文档                                                            
 Prompt tok: 704                                                            
 b9556 (旧): TTFT 0.93s / 758 tok/s                                         
 b9602 (新): 0.92s / 763 tok/s                                              
 变化: ~±0 噪声                                                             
 ────────────────────────────────────────                                   
 场景: 💻 编程场景                                                          
 Prompt tok: 532                                                            
 b9556 (旧): TTFT 0.90s / 589 tok/s                                         
 b9602 (新): 0.90s / 591 tok/s                                              
 变化: ~±0 噪声                                                             
 Decode                                                                     
                                                                            
 | 场景     | b9556 (旧) | b9602 (新) | 变化 |                              
 |----------|------------|------------|------|                              
 | 短对话   | 12.7 tok/s | 12.7 tok/s | —    |                              
 | 长文档   | 12.6 tok/s | 12.6 tok/s | —    |                              
 | 编程场景 | 12.6 tok/s | 12.6 tok/s | —    |                              
 VRAM                                                                       
                                                                            
 | 指标 | b9556 (旧) | b9602 (新)         |                                 
 |------|------------|--------------------|                                 
 | 已用 | ~15535 MiB | 15359 MiB          |                                 
 | 余量 | ~768 MiB   | 944 MiB (+176 MiB) |                                 
 结论                                                                       
                                                                            
 性能没有退化，也没有明显提升 — 三次场景的 prefill/decode                   
 差异都在测量误差范围内（&lt;3%）。                                            
                                                                            
 VRAM 余量多了约 176 MiB（15359 vs 15535），可能来自 MTP 减少 D2D 拷贝      
 或 CUDA context 重置修复 的副作用，算是个小惊喜。                          
                                                                            
 这次更新的价值在于 bug fix 安全性和稳定性（CUDA 数据竞争修复、server       
 slot/KV cache 修复），而非性能提升。
</code></pre>
]]></description><link>https://lcz.me/topic/533</link><generator>RSS for Node</generator><lastBuildDate>Tue, 22 Sep 2026 09:54:51 GMT</lastBuildDate><atom:link href="https://lcz.me/topic/533.rss" rel="self" type="application/rss+xml"/><pubDate>Fri, 12 Jun 2026 04:17:38 GMT</pubDate><ttl>60</ttl></channel></rss>