跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 AI 广场
  1. 主页
  2. 版块
  3. 随便聊聊
  4. ROCm 7.14 与 ROCm 10.0:llama.cpp Q8 160K 双卡实测

ROCm 7.14 与 ROCm 10.0:llama.cpp Q8 160K 双卡实测

已定时 已固定 已锁定 已移动 随便聊聊
rocmllama.cpp多卡部署
10 帖子 6 发布者 239 浏览 1 关注中
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • BunseiB 离线
    BunseiB 离线
    Bunsei
    德高望重 劳动模范
    编写于 最后由 Bunsei 编辑
    #1

    下午摸鱼的时候无意中发现 ROCm发布10.0了 (其实本质上是7.15🤡),不过看他版本号跨度这么大,想必定是有什么过人之处,于是让Codex替我盘盘他。

    省流:

    与 ROCm 7.14 没啥差别。

    测试平台:

    GPU:Radeon AI PRO R9700 32GB + Radeon RX 9070 16GB
    设备顺序:HIP_VISIBLE_DEVICES=1,0
    功耗上限:R9700 210W,RX 9070 200W
    llama.cpp: d3371929bb1b6982cf73f1e54156d3d426cd80a1
    ROCm 7 镜像:local/llama.cpp-rocm:7.14.0-gfx1201-rccl
    ROCm 10 镜像:local/llama.cpp-rocm:10.0.0-gfx1201-rccl
    编译参数:GGML_HIP=ON、GGML_HIP_RCCL=ON、GGML_HIP_GRAPHS=ON、AMDGPU_TARGETS=gfx1201
    模型:Qwen3.8-27B HauhauCS-Aggressive Q8_K_P
    mmproj:BF16
    KV:FP16
    上下文:160K、parallel=1
    双卡:split-mode=tensor、tensor-split=65,35、RCCL
    MTP:n-max=3
    每轮请求:160K token 输入,128 token 输出,cache_prompt=false

    结论

    核心指标 ROCm 7.14 ROCm 10.0 ROCm 10 相对变化
    160K 冷 Prefill 370.759 t/s 370.740 t/s -0.005%
    Decode 35.721 t/s 37.281 t/s +4.366%
    端到端墙钟 445.170 秒 445.058 秒 -0.025%
    1. Prefill 持平。 两版均值仅差 0.020 t/s,远小于两轮自然波动,不构成性能差异。
    2. Decode 有小幅、稳定收益。 ROCm 10 两轮分别为 37.291、37.271 t/s;ROCm 7 两轮为 35.717、35.726 t/s,提升约 4.37%。
    3. MTP 行为一致。 四轮接受率均为 89/113,即 78.761%,因此 Decode 差异不是由接受率变化造成的。
    4. 端到端无收益。 ROCm 10 平均墙钟只少 0.111 秒;对一次约 7 分 25 秒的请求,这一差异不可感知。
    1 条回复 最后回复
    2
    • BunseiB 离线
      BunseiB 离线
      Bunsei
      德高望重 劳动模范
      编写于 最后由 编辑
      #2

      原始结果

      运行时 轮次 Prefill t/s Decode t/s Prompt 秒 Decode 秒 墙钟秒 MTP 接受率
      ROCm 7.14 1 372.374 35.717 439.644 3.500 443.323 78.761%
      ROCm 7.14 2 369.145 35.726 443.490 3.499 447.016 78.761%
      ROCm 10.0 1 371.095 37.291 441.159 3.352 444.728 78.761%
      ROCm 10.0 2 370.384 37.271 442.006 3.354 445.389 78.761%
      1 条回复 最后回复
      2
      • BunseiB 离线
        BunseiB 离线
        Bunsei
        德高望重 劳动模范
        编写于 最后由 编辑
        #3

        启动参数:

        docker run -d \
          --name llama-ab \
          --device=/dev/kfd \
          --device=/dev/dri \
          --group-add 44 \
          --group-add 991 \
          --ipc=host \
          --shm-size=16g \
          --security-opt seccomp=unconfined \
          -e HIP_VISIBLE_DEVICES=1,0 \
          -e GGML_CUDA_P2P=1 \
          -e NCCL_DEBUG=WARN \
          -p 8080:8080 \
          -v /home/bunsei/models/GGUF/Qwen3.8-27B-Q8_K_P:/models:ro \
          -v /home/bunsei/.config/llama.cpp/api-key:/run/secrets/llama-api-key:ro \
          local/llama.cpp-rocm:7.14.0-gfx1201-rccl \
          --model /models/Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-Q8_K_P.gguf \
          --mmproj /models/mmproj-BF16.gguf \
          --gpu-layers all \
          --gpu-layers-draft all \
          --fit off \
          --ctx-size 163840 \
          --parallel 1 \
          --batch-size 2048 \
          --ubatch-size 512 \
          --kv-unified \
          --cache-type-k f16 \
          --cache-type-v f16 \
          --cache-type-k-draft f16 \
          --cache-type-v-draft f16 \
          --kv-offload \
          --flash-attn on \
          --split-mode tensor \
          --tensor-split 65,35 \
          --spec-type draft-mtp \
          --spec-draft-n-max 3 \
          --cache-idle-slots \
          --ctx-checkpoints 8 \
          --checkpoint-min-step 8192 \
          --image-min-tokens 1024 \
          --reasoning-format deepseek \
          --host 0.0.0.0 \
          --port 8080 \
          --ui 
        
        1 条回复 最后回复
        1
        • terryT 离线
          terryT 离线
          terry
          超级版主
          编写于 最后由 terry 编辑
          #4

          很好,省流二字价值连城

          油管:https://www.youtube.com/@抡锤者

          1 条回复 最后回复
          0
          • BunseiB 离线
            BunseiB 离线
            Bunsei
            德高望重 劳动模范
            编写于 最后由 编辑
            #5

            另外偷偷说一嘴,其实R9700跑Q8的速度在agent工作负载下是比Q6快很多的,双卡还是尽量跑Q8。

            J kos orK 2 条回复 最后回复
            0
            • lysen963L 离线
              lysen963L 离线
              lysen963
              编写于 最后由 编辑
              #6

              刚刷到ROCm,就看到坛友发了,确实省流让人佩服。

              1 条回复 最后回复
              0
              • BunseiB Bunsei

                另外偷偷说一嘴,其实R9700跑Q8的速度在agent工作负载下是比Q6快很多的,双卡还是尽量跑Q8。

                J 离线
                J 离线
                johnnybegood
                劳动模范 技术大牛
                编写于 最后由 编辑
                #7

                @Bunsei 为啥呢?

                1 条回复 最后回复
                0
                • BunseiB Bunsei

                  另外偷偷说一嘴,其实R9700跑Q8的速度在agent工作负载下是比Q6快很多的,双卡还是尽量跑Q8。

                  kos orK 离线
                  kos orK 离线
                  kos or
                  超凡大师
                  编写于 最后由 kos or 编辑
                  #8

                  @Bunsei said:

                  Q8的速度在agent工作负载下是比Q6快很多的

                  請問 這是因為Q8 有硬體解碼的因素嗎?
                  所以只要 VRAM裝得下, Q8/FP8 速度上 > Q6/Q4 ?

                  754790cb-5629-4949-ad54-5f1bbfb5c4a2-image.jpeg

                  1 条回复 最后回复
                  0
                  • BunseiB 离线
                    BunseiB 离线
                    Bunsei
                    德高望重 劳动模范
                    编写于 最后由 编辑
                    #9

                    @johnnybegood
                    @kos-or

                    个人实测得出的,而且更小的量化格式并不一定代表速度更快,具体原因我猜测可能跟数据结构有关,毕竟没有原生“6位格式”,处理时候可能会更麻烦?不过如果你能跑Q8量化,那么说明肯定是双卡,直接上vLLM、FP8格式的模型速度更快,双卡下在接近160K+上下文的情况下能稳定1000+的预填充速度解码开启MTP之后也能三四十。

                    1 条回复 最后回复
                    1
                    • paul houP 离线
                      paul houP 离线
                      paul hou
                      编写于 最后由 编辑
                      #10

                      之前有查詢ROCM 10主要是為了MI400出的,跟R9700的RDNA4一點關係都沒有。

                      1 条回复 最后回复
                      0

                      你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

                      厌倦了每次访问都刷到同样的帖子?您注册账号后,您每次返回时都能精准定位到您上次浏览的位置,并可选择接收新回复通知(通过邮件或推送通知)。您还能收藏书签、为帖子顶,向社区成员表达您的欣赏。

                      有了你的建议,这篇帖子会更精彩哦 💗

                      注册 登录
                      回复
                      • 在新帖中回复
                      登录后回复
                      • 从旧到新
                      • 从新到旧
                      • 最多赞同


                      • 登录

                      • 登录或注册以进行搜索。
                      • 第一个帖子
                        最后一个帖子
                      0
                      • 版块
                      • 最新
                      • 标签
                      • 热门
                      • 用户
                      • 群组