跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
折叠
品牌标识

抡锤者

  1. 主页
  2. 版块
  3. AI硬件
  4. rtx pro 6000 max-q配合qwen3.6 MTP开到20收获前所有见的效率

rtx pro 6000 max-q配合qwen3.6 MTP开到20收获前所有见的效率

已定时 已固定 已锁定 已移动 AI硬件
rtxpro6000qwen-27b
6 帖子 4 发布者 174 浏览
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • Tony Xu 0T 离线
    Tony Xu 0T 离线
    Tony Xu 0
    编写于 最后由 Tony Xu 0 编辑
    #1

    之前一直在做模型输出结构优化,MTP一直用在3,生成速度大概稳定在85 tokens/s,无意间发现MTP第三位居然稳定在0.97以上,后续索性把MTP加到10后第十位也居然稳定在0.95以上,干脆一不做二不休再次翻倍开20,单次请求得到如下log。还没有完全优化完,只是边做工作边刻意的想着优化结构化输出,先把工作完成等到后续性能调优再看能不能让数据更漂亮
    你怎么看@xiaote

    (APIServer pid=1565552) INFO 07-28 20:35:19 [loggers.py:273] Engine 000: Avg prompt throughput: 1818.1 tokens/s, Avg generation throughput: 71.2 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 23.7%, Prefix cache hit rate: 18.3%
    (APIServer pid=1565552) INFO 07-28 20:35:19 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 15.13, Accepted throughput: 0.19 tokens/s, Drafted throughput: 0.22 tokens/s, Accepted: 664 tokens, Drafted: 769 tokens, Per-position acceptance rate: 0.979, 0.894, 0.894, 0.894, 0.872, 0.872, 0.872, 0.809, 0.787, 0.766, 0.745, 0.681, 0.638, 0.553, 0.532, 0.532, 0.468, 0.447, 0.447, 0.447, Avg Draft acceptance rate: 86.3%
    (APIServer pid=1565552) INFO 07-28 20:35:29 [loggers.py:273] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 241.9 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 24.3%, Prefix cache hit rate: 18.3%
    (APIServer pid=1565552) INFO 07-28 20:35:29 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 19.05, Accepted throughput: 229.21 tokens/s, Drafted throughput: 249.11 tokens/s, Accepted: 2292 tokens, Drafted: 2491 tokens, Per-position acceptance rate: 1.000, 0.992, 0.976, 0.976, 0.969, 0.961, 0.953, 0.953, 0.937, 0.929, 0.913, 0.913, 0.898, 0.866, 0.850, 0.835, 0.819, 0.795, 0.764, 0.748, Avg Draft acceptance rate: 92.0%
    (APIServer pid=1565552) INFO 07-28 20:35:39 [loggers.py:273] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 244.4 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 25.1%, Prefix cache hit rate: 18.3%
    (APIServer pid=1565552) INFO 07-28 20:35:39 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 19.55, Accepted throughput: 231.89 tokens/s, Drafted throughput: 247.69 tokens/s, Accepted: 2319 tokens, Drafted: 2477 tokens, Per-position acceptance rate: 1.000, 0.992, 0.992, 0.992, 0.992, 0.984, 0.984, 0.984, 0.976, 0.976, 0.968, 0.944, 0.920, 0.904, 0.880, 0.880, 0.824, 0.808, 0.792, 0.760, Avg Draft acceptance rate: 93.6%
    (APIServer pid=1565552) INFO 07-28 20:35:49 [loggers.py:273] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 248.7 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 26.0%, Prefix cache hit rate: 18.3%
    (APIServer pid=1565552) INFO 07-28 20:35:49 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 20.22, Accepted throughput: 236.40 tokens/s, Drafted throughput: 245.90 tokens/s, Accepted: 2364 tokens, Drafted: 2459 tokens, Per-position acceptance rate: 1.000, 1.000, 1.000, 1.000, 1.000, 1.000, 1.000, 0.984, 0.984, 0.984, 0.967, 0.967, 0.959, 0.951, 0.943, 0.927, 0.902, 0.894, 0.886, 0.870, Avg Draft acceptance rate: 96.1%
    (APIServer pid=1565552) INFO: 127.0.0.1:34096 - "POST /v1/chat/completions HTTP/1.1" 200 OK

    kos orK 1 条回复 最后回复
    0
    • Tony Xu 0T Tony Xu 0

      之前一直在做模型输出结构优化,MTP一直用在3,生成速度大概稳定在85 tokens/s,无意间发现MTP第三位居然稳定在0.97以上,后续索性把MTP加到10后第十位也居然稳定在0.95以上,干脆一不做二不休再次翻倍开20,单次请求得到如下log。还没有完全优化完,只是边做工作边刻意的想着优化结构化输出,先把工作完成等到后续性能调优再看能不能让数据更漂亮
      你怎么看@xiaote

      (APIServer pid=1565552) INFO 07-28 20:35:19 [loggers.py:273] Engine 000: Avg prompt throughput: 1818.1 tokens/s, Avg generation throughput: 71.2 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 23.7%, Prefix cache hit rate: 18.3%
      (APIServer pid=1565552) INFO 07-28 20:35:19 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 15.13, Accepted throughput: 0.19 tokens/s, Drafted throughput: 0.22 tokens/s, Accepted: 664 tokens, Drafted: 769 tokens, Per-position acceptance rate: 0.979, 0.894, 0.894, 0.894, 0.872, 0.872, 0.872, 0.809, 0.787, 0.766, 0.745, 0.681, 0.638, 0.553, 0.532, 0.532, 0.468, 0.447, 0.447, 0.447, Avg Draft acceptance rate: 86.3%
      (APIServer pid=1565552) INFO 07-28 20:35:29 [loggers.py:273] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 241.9 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 24.3%, Prefix cache hit rate: 18.3%
      (APIServer pid=1565552) INFO 07-28 20:35:29 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 19.05, Accepted throughput: 229.21 tokens/s, Drafted throughput: 249.11 tokens/s, Accepted: 2292 tokens, Drafted: 2491 tokens, Per-position acceptance rate: 1.000, 0.992, 0.976, 0.976, 0.969, 0.961, 0.953, 0.953, 0.937, 0.929, 0.913, 0.913, 0.898, 0.866, 0.850, 0.835, 0.819, 0.795, 0.764, 0.748, Avg Draft acceptance rate: 92.0%
      (APIServer pid=1565552) INFO 07-28 20:35:39 [loggers.py:273] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 244.4 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 25.1%, Prefix cache hit rate: 18.3%
      (APIServer pid=1565552) INFO 07-28 20:35:39 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 19.55, Accepted throughput: 231.89 tokens/s, Drafted throughput: 247.69 tokens/s, Accepted: 2319 tokens, Drafted: 2477 tokens, Per-position acceptance rate: 1.000, 0.992, 0.992, 0.992, 0.992, 0.984, 0.984, 0.984, 0.976, 0.976, 0.968, 0.944, 0.920, 0.904, 0.880, 0.880, 0.824, 0.808, 0.792, 0.760, Avg Draft acceptance rate: 93.6%
      (APIServer pid=1565552) INFO 07-28 20:35:49 [loggers.py:273] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 248.7 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 26.0%, Prefix cache hit rate: 18.3%
      (APIServer pid=1565552) INFO 07-28 20:35:49 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 20.22, Accepted throughput: 236.40 tokens/s, Drafted throughput: 245.90 tokens/s, Accepted: 2364 tokens, Drafted: 2459 tokens, Per-position acceptance rate: 1.000, 1.000, 1.000, 1.000, 1.000, 1.000, 1.000, 0.984, 0.984, 0.984, 0.967, 0.967, 0.959, 0.951, 0.943, 0.927, 0.902, 0.894, 0.886, 0.870, Avg Draft acceptance rate: 96.1%
      (APIServer pid=1565552) INFO: 127.0.0.1:34096 - "POST /v1/chat/completions HTTP/1.1" 200 OK

      kos orK 离线
      kos orK 离线
      kos or
      技术大牛 劳动模范
      编写于 最后由 编辑
      #2

      @Tony-Xu-0 said:

      Avg generation throughput: 241.9 tokens/s

      MTP = 20 可以高達這個速度嗎?

      Tony Xu 0T 1 条回复 最后回复
      0
      • kos orK kos or

        @Tony-Xu-0 said:

        Avg generation throughput: 241.9 tokens/s

        MTP = 20 可以高達這個速度嗎?

        Tony Xu 0T 离线
        Tony Xu 0T 离线
        Tony Xu 0
        编写于 最后由 编辑
        #3

        @kos-or 说:

        @Tony-Xu-0 said:

        Avg generation throughput: 241.9 tokens/s

        MTP = 20 可以高達這個速度嗎?

        是的,但是要优化输出结构,实际之后又试了MTP=30/40,请求处理跑起来以后生成速度稳定上350 tokens/s,但是效率收益递减,没再开

        1 条回复 最后回复
        1
        • kop wangK 离线
          kop wangK 离线
          kop wang
          超级版主
          编写于 最后由 编辑
          #4

          但是prefill速度也降了。总体上来讲,目前的重Agent场景,总体性能,prefill和decode速度各占一半。

          虚心交流,一起进步

          terryT Tony Xu 0T 2 条回复 最后回复
          1
          • kop wangK kop wang

            但是prefill速度也降了。总体上来讲,目前的重Agent场景,总体性能,prefill和decode速度各占一半。

            terryT 离线
            terryT 离线
            terry
            超级版主
            编写于 最后由 编辑
            #5

            @kop-wang Agent场景的话就用SG-Lang了,如果要是考虑高并发API访问,VLLM有自己的优势,吐字速度确实是比SG-Lang强。

            油管:https://www.youtube.com/@抡锤者

            1 条回复 最后回复
            1
            • kop wangK kop wang

              但是prefill速度也降了。总体上来讲,目前的重Agent场景,总体性能,prefill和decode速度各占一半。

              Tony Xu 0T 离线
              Tony Xu 0T 离线
              Tony Xu 0
              编写于 最后由 Tony Xu 0 编辑
              #6

              @kop-wang 说:

              但是prefill速度也降了。总体上来讲,目前的重Agent场景,总体性能,prefill和decode速度各占一半。

              agent得另算,我使用场景关注并发,不关注TTFT等延迟。这个log现在不优化直接开batch=4并发已经可以输出接近1000 tokens/s,还是在我把vllm的gpu利用率限制在0.55情况下,这要升级到0.92后续继续优化我都不敢想,没准直接上1800了

              1 条回复 最后回复
              0

              你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

              厌倦了每次访问都刷到同样的帖子?您注册账号后,您每次返回时都能精准定位到您上次浏览的位置,并可选择接收新回复通知(通过邮件或推送通知)。您还能收藏书签、为帖子顶,向社区成员表达您的欣赏。

              有了你的建议,这篇帖子会更精彩哦 💗

              注册 登录
              回复
              • 在新帖中回复
              登录后回复
              • 从旧到新
              • 从新到旧
              • 最多赞同


              • 登录

              • 没有帐号? 注册

              • 登录或注册以进行搜索。
              • 第一个帖子
                最后一个帖子
              0
              • 版块
              • 最新
              • 标签
              • 热门
              • 用户
              • 群组