跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 AI 广场
  1. 主页
  2. 版块
  3. LLM讨论区
  4. 分享一下我本地的一套vllm 的方案,不能用MTP ,Dflash2 加速,但是可以用 int8 KV, 真正的8并发,总吞吐 240

分享一下我本地的一套vllm 的方案,不能用MTP ,Dflash2 加速,但是可以用 int8 KV, 真正的8并发,总吞吐 240

已定时 已固定 已锁定 已移动 LLM讨论区
vllmqwen-27b量化
1 帖子 1 发布者 30 浏览
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题由 7900XTX双卡TP,SGLang & VLLM 多Agent多并发测试对比(续三)- 最终测试对比报告(基于自己的工作流) 分支而来 terry
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • Ben LeeB Ben Lee

    @farmer-node 看的这么仔细啊,感谢关注哈~这个参数确实是我之前加过的。后来升级到新版 SGLang(f84475c)之后,官方把它移除了,我当时的第一反应真的就是"天塌了"😅 不过好在找到了替代方案 --enable-mixed-chunk,思路类似但实现更干净,效果还略好一丢,所以现在的 production 就没再单独加回那个参数了。

    这段过程我在续一里写过,在测试数据后面的"附录:小白折腾记"那部分,第一节”一、N=1 没了,天塌了“,有兴趣可以翻一下:https://lcz.me/topic/1740

    farmer nodeF
    farmer nodeF
    farmer node
    德高望重
    编写于 最后由 farmer node 编辑
    #1

    @Ben-Lee 你这个方案是我sglang 本地的高速方案,我分享一下我本地的另一套vllm 的方案,不能用MTP ,Dflash2 加速,但是可以用 int8 KV, 真正的8并发,总吞吐 240
    左右:

    • GitHub 仓库:https://github.com/JartX/vllm
    • 分支:perf/rdna3_full_stack
    • 实测 Commit ID:c5647a6d4695279456d830d6c2f52edd4c54524a
    • 核心修复项:
      1. QuickReduce 跨卡 PCIe 描述符修复(0x31014000):彻底消除 RDNA3 双卡通信读 0 乱码与静默死锁;
      2. Qwen GDN MTP:修复预热阶段 index_copy_ 的 dtype 异常。

    二、 部署配置与显存 / KV Cache 切片

    1. 生产甜点位启动命令
      bash
      docker run -d
      --name vllm-prod
      --ipc=host
      --network=host
      --shm-size=32g
      --device=/dev/kfd
      --device=/dev/dri
      --group-add video
      -e HSA_OVERRIDE_GFX_VERSION=11.0.0
      -e ROCR_VISIBLE_DEVICES=0,1
      -e PYTHONPATH="/opt/rocm-7.2.4/share/amd_smi"
      -v /home/kuma/models:/models:ro
      jartx-vllm:latest
      vllm serve /models/Qwen3.8-27B-W4A16-AutoRound
      --host 0.0.0.0
      --port 8080
      --tensor-parallel-size 2
      --kv-cache-dtype int8_per_token_head
      --max-model-len 131072
      --max-num-seqs 8
      --max-num-batched-tokens 8192
      --attention-backend TRITON_ATTN
      --enable-prefix-caching
      --enable-chunked-prefill
      --gpu-memory-utilization 0.95
      --trust-remote-code

    2. 显存分配切片(2×24GB 运行时抓取)

    • 单卡物理显存:23.98 GiB
    • 静态权重 + 基础开销:9.70 GiB
    • Peak Activation(峰值激活):2.41 GiB
    • CUDAGraph 内存:0.67 GiB
    • 动态 KV Cache 可用显存:10.68 GiB / 卡
    • 物理 KV Cache 总容量:638,075 tokens(约 63.8 万 tokens)
    • 单请求上下文上限 (max-model-len):131,072 tokens (131K)
    • 物理并发承载力:
      • 131K 极限上下文:支持 4.87 倍并发(4 路 120K 超长文本吃满不排队)
      • 32K Agent 常见上下文:支持 19.9 倍并发
      • 8K 短对话:支持 79.7 倍并发

    三、 全梯队压测实测数据(纯并发模式,流式解耦)

    测试场景 / 上下文深度: 短文本 (1K~4K)
    并发路数: 1 路
    首字延迟 (TTFT): 0.40 s
    单路纯解码速率: 56.16 tok/s
    稳态聚合吞吐 (实测): 56.16 tok/s
    表现分析: 超过作者 49.2 t/s 基准 +15.5%
    ────────────────────────────────────────
    测试场景 / 上下文深度: 短文本 (1K~4K)
    并发路数: 2 路
    首字延迟 (TTFT): 0.54 s
    单路纯解码速率: 47.22 tok/s
    稳态聚合吞吐 (实测): 94.44 tok/s
    表现分析: 近似线性扩展
    ────────────────────────────────────────
    测试场景 / 上下文深度: 短文本 (1K~4K)
    并发路数: 4 路
    首字延迟 (TTFT): 1.00 s
    单路纯解码速率: 43.10 tok/s
    稳态聚合吞吐 (实测): 172.39 tok/s
    表现分析: 高吞吐甜点位
    ────────────────────────────────────────
    测试场景 / 上下文深度: 短文本 (1K~4K)
    并发路数: 8 路
    首字延迟 (TTFT): 2.11 s
    单路纯解码速率: 30.94 tok/s
    稳态聚合吞吐 (实测): 247.53 tok/s
    表现分析: 触及双卡 512GB/s 显存带宽物理极限
    ────────────────────────────────────────
    测试场景 / 上下文深度: 中长文本 (30K)
    并发路数: 1 路
    首字延迟 (TTFT): 11.03 s
    单路纯解码速率: 51.47 tok/s
    稳态聚合吞吐 (实测): 51.47 tok/s
    表现分析: 30K 深度下解码几乎不衰减
    ────────────────────────────────────────
    测试场景 / 上下文深度: 中长文本 (60K)
    并发路数: 4 路
    首字延迟 (TTFT): 15.60 s
    单路纯解码速率: 33.64 tok/s
    稳态聚合吞吐 (实测): 134.55 tok/s
    表现分析: 稳态多路并发
    ────────────────────────────────────────
    测试场景 / 上下文深度: 超长文本 (120K)
    并发路数: 1 路
    首字延迟 (TTFT): 34.24 s
    单路纯解码速率: 40.72 tok/s
    稳态聚合吞吐 (实测): 40.72 tok/s
    表现分析: 单流超长无 OOM,解码保持 40+ tok/s
    ────────────────────────────────────────
    测试场景 / 上下文深度: 超长文本 (120K)
    并发路数: 4 路
    首字延迟 (TTFT): 1.54 s*
    单路纯解码速率: 25.90 tok/s
    稳态聚合吞吐 (实测): 103.60 tok/s
    表现分析: 前缀共享缓存命中率 71.8%,吞吐破百

    terryT 1 条回复 最后回复
    1

    你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

    厌倦了每次访问都刷到同样的帖子?您注册账号后,您下次访问时都将自动回到上次浏览的位置,并可选择接收新回复的通知(通过电子邮件或推送通知)。您还可以收藏帖子、为帖子点赞,以此向其他社区成员表达您的感谢。

    有了你的建议,这篇帖子会更精彩哦 💗

    注册 登录
    回复
    • 在新帖中回复
    登录后回复
    • 从旧到新
    • 从新到旧
    • 最多赞同


    • 登录

    • 登录或注册以进行搜索。
    • 第一个帖子
      最后一个帖子
    0
    • 版块
    • 最新
    • 标签
    • 热门
    • 用户
    • 群组