<?xml version="1.0" encoding="UTF-8"?><rss xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title><![CDATA[分享一下我本地的一套vllm 的方案，不能用MTP ,Dflash2 加速，但是可以用 int8 KV， 真正的8并发，总吞吐 240]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/ben-lee" aria-label="Profile: Ben-Lee">@<bdi>Ben-Lee</bdi></a> 你这个方案是我sglang 本地的高速方案，我分享一下我本地的另一套vllm 的方案，不能用MTP ,Dflash2 加速，但是可以用 int8 KV， 真正的8并发，总吞吐 240<br />
左右：</p>
<ul>
<li>GitHub 仓库：<a href="https://github.com/JartX/vllm" rel="nofollow ugc">https://github.com/JartX/vllm</a></li>
<li>分支：perf/rdna3_full_stack</li>
<li>实测 Commit ID：c5647a6d4695279456d830d6c2f52edd4c54524a</li>
<li>核心修复项：
<ol>
<li>QuickReduce 跨卡 PCIe 描述符修复（0x31014000）：彻底消除 RDNA3 双卡通信读 0 乱码与静默死锁；</li>
<li>Qwen GDN MTP：修复预热阶段 index_copy_ 的 dtype 异常。</li>
</ol>
</li>
</ul>
<p dir="auto">二、 部署配置与显存 / KV Cache 切片</p>
<ol>
<li>
<p dir="auto">生产甜点位启动命令<br />
bash<br />
docker run -d <br />
--name vllm-prod <br />
--ipc=host <br />
--network=host <br />
--shm-size=32g <br />
--device=/dev/kfd <br />
--device=/dev/dri <br />
--group-add video <br />
-e HSA_OVERRIDE_GFX_VERSION=11.0.0 <br />
-e ROCR_VISIBLE_DEVICES=0,1 <br />
-e PYTHONPATH="/opt/rocm-7.2.4/share/amd_smi" <br />
-v /home/kuma/models:/models:ro <br />
jartx-vllm:latest <br />
vllm serve /models/Qwen3.8-27B-W4A16-AutoRound <br />
--host 0.0.0.0 <br />
--port 8080 <br />
--tensor-parallel-size 2 <br />
--kv-cache-dtype int8_per_token_head <br />
--max-model-len 131072 <br />
--max-num-seqs 8 <br />
--max-num-batched-tokens 8192 <br />
--attention-backend TRITON_ATTN <br />
--enable-prefix-caching <br />
--enable-chunked-prefill <br />
--gpu-memory-utilization 0.95 <br />
--trust-remote-code</p>
</li>
<li>
<p dir="auto">显存分配切片（2×24GB 运行时抓取）</p>
</li>
</ol>
<ul>
<li>单卡物理显存：23.98 GiB</li>
<li>静态权重 + 基础开销：9.70 GiB</li>
<li>Peak Activation（峰值激活）：2.41 GiB</li>
<li>CUDAGraph 内存：0.67 GiB</li>
<li>动态 KV Cache 可用显存：10.68 GiB / 卡</li>
<li>物理 KV Cache 总容量：638,075 tokens（约 63.8 万 tokens）</li>
<li>单请求上下文上限 (max-model-len)：131,072 tokens (131K)</li>
<li>物理并发承载力：
<ul>
<li>131K 极限上下文：支持 4.87 倍并发（4 路 120K 超长文本吃满不排队）</li>
<li>32K Agent 常见上下文：支持 19.9 倍并发</li>
<li>8K 短对话：支持 79.7 倍并发</li>
</ul>
</li>
</ul>
<p dir="auto">三、 全梯队压测实测数据（纯并发模式，流式解耦）</p>
<p dir="auto">测试场景 / 上下文深度: 短文本 (1K~4K)<br />
并发路数: 1 路<br />
首字延迟 (TTFT): 0.40 s<br />
单路纯解码速率: 56.16 tok/s<br />
稳态聚合吞吐 (实测): 56.16 tok/s<br />
表现分析: 超过作者 49.2 t/s 基准 +15.5%<br />
────────────────────────────────────────<br />
测试场景 / 上下文深度: 短文本 (1K~4K)<br />
并发路数: 2 路<br />
首字延迟 (TTFT): 0.54 s<br />
单路纯解码速率: 47.22 tok/s<br />
稳态聚合吞吐 (实测): 94.44 tok/s<br />
表现分析: 近似线性扩展<br />
────────────────────────────────────────<br />
测试场景 / 上下文深度: 短文本 (1K~4K)<br />
并发路数: 4 路<br />
首字延迟 (TTFT): 1.00 s<br />
单路纯解码速率: 43.10 tok/s<br />
稳态聚合吞吐 (实测): 172.39 tok/s<br />
表现分析: 高吞吐甜点位<br />
────────────────────────────────────────<br />
测试场景 / 上下文深度: 短文本 (1K~4K)<br />
并发路数: 8 路<br />
首字延迟 (TTFT): 2.11 s<br />
单路纯解码速率: 30.94 tok/s<br />
稳态聚合吞吐 (实测): 247.53 tok/s<br />
表现分析: 触及双卡 512GB/s 显存带宽物理极限<br />
────────────────────────────────────────<br />
测试场景 / 上下文深度: 中长文本 (30K)<br />
并发路数: 1 路<br />
首字延迟 (TTFT): 11.03 s<br />
单路纯解码速率: 51.47 tok/s<br />
稳态聚合吞吐 (实测): 51.47 tok/s<br />
表现分析: 30K 深度下解码几乎不衰减<br />
────────────────────────────────────────<br />
测试场景 / 上下文深度: 中长文本 (60K)<br />
并发路数: 4 路<br />
首字延迟 (TTFT): 15.60 s<br />
单路纯解码速率: 33.64 tok/s<br />
稳态聚合吞吐 (实测): 134.55 tok/s<br />
表现分析: 稳态多路并发<br />
────────────────────────────────────────<br />
测试场景 / 上下文深度: 超长文本 (120K)<br />
并发路数: 1 路<br />
首字延迟 (TTFT): 34.24 s<br />
单路纯解码速率: 40.72 tok/s<br />
稳态聚合吞吐 (实测): 40.72 tok/s<br />
表现分析: 单流超长无 OOM，解码保持 40+ tok/s<br />
────────────────────────────────────────<br />
测试场景 / 上下文深度: 超长文本 (120K)<br />
并发路数: 4 路<br />
首字延迟 (TTFT): 1.54 s*<br />
单路纯解码速率: 25.90 tok/s<br />
稳态聚合吞吐 (实测): 103.60 tok/s<br />
表现分析: 前缀共享缓存命中率 71.8%，吞吐破百</p>
]]></description><link>https://lcz.me/topic/1865</link><generator>RSS for Node</generator><lastBuildDate>Fri, 25 Sep 2026 21:27:23 GMT</lastBuildDate><atom:link href="https://lcz.me/topic/1865.rss" rel="self" type="application/rss+xml"/><pubDate>Sun, 20 Sep 2026 09:01:24 GMT</pubDate><ttl>60</ttl></channel></rss>