跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 AI 广场
  1. 主页
  2. 版块
  3. LLM讨论区
  4. TurboQuant 还真是比 FP8 慢了很多

TurboQuant 还真是比 FP8 慢了很多

已定时 已固定 已锁定 已移动 LLM讨论区
turboquant
1 帖子 1 发布者 88 浏览
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • C 离线
    C 离线
    Che
    德高望重
    编写于 最后由 编辑
    #1

    TurboQuant 好处是 KVCache 容量比 FP8 大了将近1倍(仅以我的设备为例;vLLM):

    FP8:

    GPU KV cache size: 1,006,391 tokens

    TurboQuant:

    GPU KV cache size: 1,900,544 tokens


    官方声称 TurboQuant 吞吐量比 FP8 低很多,我还不以为意;接入 harness 实战后,降速凸显:

    FP8,多并发:

    Avg generation throughput: 443.6 tokens/s, Running: 12 reqs, Waiting: 0 reqs, GPU KV cache usage: 18.0%

    TurboQuant,多并发:

    Avg generation throughput: 264.0 tokens/s, Running: 12 reqs, Waiting: 0 reqs, GPU KV cache usage: 9.2%

    FP8,单并发,约 72k 时:

    Avg generation throughput: 56.0 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.3%

    TurboQuant,单并发,约 72k 时:

    Avg generation throughput: 22.0 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 3.8%

    可见 TurboQuant 比 FP8 至少慢了 40%,而且越长越慢。真的是没有白捡的 KVCache

    1 条回复 最后回复
    1

    你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

    厌倦了每次访问都刷到同样的帖子?您注册账号后,您每次返回时都能精准定位到您上次浏览的位置,并可选择接收新回复通知(通过邮件或推送通知)。您还能收藏书签、为帖子顶,向社区成员表达您的欣赏。

    有了你的建议,这篇帖子会更精彩哦 💗

    注册 登录
    回复
    • 在新帖中回复
    登录后回复
    • 从旧到新
    • 从新到旧
    • 最多赞同


    • 登录

    • 登录或注册以进行搜索。
    • 第一个帖子
      最后一个帖子
    0
    • 版块
    • 最新
    • 标签
    • 热门
    • 用户
    • 群组