跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 AI 广场
  1. 主页
  2. 版块
  3. LLM讨论区
  4. 單張R9700 AI PRO 32G + VLLM + amd/Qwen3.8-27B-Quark-AWQ-MXFP4

單張R9700 AI PRO 32G + VLLM + amd/Qwen3.8-27B-Quark-AWQ-MXFP4

已定时 已固定 已锁定 已移动 LLM讨论区
r9700vllmqwen-27b
11 帖子 5 发布者 135 浏览
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • paul houP 在线
    paul houP 在线
    paul hou
    编写于 最后由 编辑
    #1

    之前本地佈署都是靠著網站上的大神們的分享
    這個假日測了整整二天VLLM,最終使用了這個方案,結果不錯分享一下。

    https://github.com/magiccodingman/vllm-radiance

    模型

    • 主模型:/models/amd/Qwen3.8-27B-Quark-AWQ-MXFP4(served name: qwen3.8-27b-mxfp4)
    • Draft 模型:/models/tcclaviger/Qwen3.8-27B-DFlash2-FP8
    • 量化:MXFP4(W4A8),RADIANCE_MXFP4=1 + 全套 radiance 優化旗標(WPERM、HOIST_QUANT、EPIFAST、SKINNY_GEMM、R4D attention 等)

    引擎參數

    • tensor-parallel-size: 1(單卡 R9700 / gfx1201)
    • gpu-memory-utilization: 0.98
    • kv-cache-dtype: fp8,--kv-cache-memory 7,783,339,733 bytes(~7.3GB 固定分配)
    • max-num-seqs: 8
    • max-model-len: 163,840
    • max-num-batched-tokens: 8,192
    • attention-backend: R4D(+ RADIANCE_USE_R4D_GDN / R4D_AR / R4D_AR_QUANT)
    • speculative decoding: dflash,num_speculative_tokens=7,TRITON_ATTN,disable_padded_drafter_batch
    • mamba-cache-mode: align
    • prefix caching: 啟用
    • no-async-scheduling
    • tool call: qwen3_xml parser;reasoning parser: qwen3
    • override generation config: temperature 0.7 / top_p 0.95 / top_k 20
    • chat template: qwen-fixed-v22.3.jinja(掛載為 /chat-template.jinja)
    • language-model-only、trust-remote-code、HF_HUB_OFFLINE

    實際運行狀態(/metrics)

    • KV cache:288 blocks,共 180,098 tokens 容量,fp8
    • prefix cache 命中率:1.85M / 2.44M ≈ 75.9%
    • dflash spec decode:48,588 draft tokens → 17,180 accepted,整體接受率約 35%;position 0 接受率 69%(4920/7108),逐位遞減到 position 6 約 15%
    • 目前 0 running / 0 waiting,KV 使用率 0%
    • AITER:只啟用 UNIFIED_ATTENTION,其餘(MHA/MOE/MLA/RMSNORM/FP4BMM/FP8BMM)全關

    Prefill(長 context 預填)速度:

    prompt 長度 實際 tokens TTFT prefill 速度
    8K 7,470 3.22s 2,319 tok/s
    32K 29,742 11.49s 2,589 tok/s
    64K 59,409 17.95s 3,311 tok/s
    128K 118,772 45.52s 2,609 tok/s

    Prefill 穩定在 2,300-3,300 tok/s,128K context 約 45 秒完成預填。

    併發測試(每路 max 256 tok):

    併發路數 wall time 總輸出 聚合速度 單路速度
    1(先前) - 298 tok 41.5 tok/s 41.5
    2 7.5s 459 tok 61.4 tok/s 29-34
    4 8.7s 982 tok 113.5 tok/s 25-42
    8 12.7s 1,941 tok 152.4 tok/s 27-42

    實際在DSH的使用,單路思考時是很穩定在40 t/s左右,編程時會到70~80 t/s
    ,比起llama.cpp + UD-Q4_K_XL 思考時25~40t/s,編程時50~75 t/s 效能好上不少。

    kos orK 1 条回复 最后回复
    2
    • paul houP 在线
      paul houP 在线
      paul hou
      编写于 最后由 编辑
      #2

      補充一下,OS是CACHYOS,關閉所有圖形介面後,開機VRAM只佔65M。

      1 条回复 最后回复
      0
      • L 在线
        L 在线
        linghu007
        编写于 最后由 编辑
        #3

        多谢分享,但我试了,同样参数我显存不够(大概多了2g),我开机100M显存占用。

        1 条回复 最后回复
        0
        • paul houP 在线
          paul houP 在线
          paul hou
          编写于 最后由 paul hou 编辑
          #4

          我是純LLM SERVER的方式在用,所以可以壓榨所有的VRAM來使用,另外是放棄了多模態沒上載入。二併發的情況下還是滿好用的。
          這套99.9%都是HERMES+DSV4F安裝好的,那2G應該可以想辦法搞出來。
          DSH新會話大約是3秒就開始動作,所以PREFILL是破3000的,這是我用這個的重點。

          1225f3f2-cf51-4b23-9959-f10088fdb83b-image.jpeg

          1 条回复 最后回复
          1
          • A 离线
            A 离线
            andyfay
            编写于 最后由 编辑
            #5

            用这个模型建议两张R9700,单流速度150以上

            1 条回复 最后回复
            0
            • paul houP 在线
              paul houP 在线
              paul hou
              编写于 最后由 编辑
              #6

              電費,設備,預算,使用情境,老婆的臉色,目前只支持一張R9700。

              zhenyu huangZ 1 条回复 最后回复
              0
              • paul houP paul hou

                電費,設備,預算,使用情境,老婆的臉色,目前只支持一張R9700。

                zhenyu huangZ 离线
                zhenyu huangZ 离线
                zhenyu huang
                编写于 最后由 编辑
                #7

                @paul-hou profill速度怎么那么快 是因为量化等级小吗

                zhenyu huangZ 1 条回复 最后回复
                1
                • zhenyu huangZ zhenyu huang

                  @paul-hou profill速度怎么那么快 是因为量化等级小吗

                  zhenyu huangZ 离线
                  zhenyu huangZ 离线
                  zhenyu huang
                  编写于 最后由 编辑
                  #8

                  还是前缀缓存命中了?

                  1 条回复 最后回复
                  0
                  • paul houP 在线
                    paul houP 在线
                    paul hou
                    编写于 最后由 编辑
                    #9

                    不確定是dflash2有加快,還是整個vllm設定和amd自己量化的模型有特別的優化,過程中裝了三種vllm,確實另外二個就是1200左右的prefill,decode 還有慢到只有15左右的。

                    今天整天用下來比之前用vulkan + Q6或Q4快很多,不過2併發的編程就不用想了,run2只能做很簡單的小事,不然會整體拖慢速度。

                    1 条回复 最后回复
                    0
                    • paul houP paul hou

                      之前本地佈署都是靠著網站上的大神們的分享
                      這個假日測了整整二天VLLM,最終使用了這個方案,結果不錯分享一下。

                      https://github.com/magiccodingman/vllm-radiance

                      模型

                      • 主模型:/models/amd/Qwen3.8-27B-Quark-AWQ-MXFP4(served name: qwen3.8-27b-mxfp4)
                      • Draft 模型:/models/tcclaviger/Qwen3.8-27B-DFlash2-FP8
                      • 量化:MXFP4(W4A8),RADIANCE_MXFP4=1 + 全套 radiance 優化旗標(WPERM、HOIST_QUANT、EPIFAST、SKINNY_GEMM、R4D attention 等)

                      引擎參數

                      • tensor-parallel-size: 1(單卡 R9700 / gfx1201)
                      • gpu-memory-utilization: 0.98
                      • kv-cache-dtype: fp8,--kv-cache-memory 7,783,339,733 bytes(~7.3GB 固定分配)
                      • max-num-seqs: 8
                      • max-model-len: 163,840
                      • max-num-batched-tokens: 8,192
                      • attention-backend: R4D(+ RADIANCE_USE_R4D_GDN / R4D_AR / R4D_AR_QUANT)
                      • speculative decoding: dflash,num_speculative_tokens=7,TRITON_ATTN,disable_padded_drafter_batch
                      • mamba-cache-mode: align
                      • prefix caching: 啟用
                      • no-async-scheduling
                      • tool call: qwen3_xml parser;reasoning parser: qwen3
                      • override generation config: temperature 0.7 / top_p 0.95 / top_k 20
                      • chat template: qwen-fixed-v22.3.jinja(掛載為 /chat-template.jinja)
                      • language-model-only、trust-remote-code、HF_HUB_OFFLINE

                      實際運行狀態(/metrics)

                      • KV cache:288 blocks,共 180,098 tokens 容量,fp8
                      • prefix cache 命中率:1.85M / 2.44M ≈ 75.9%
                      • dflash spec decode:48,588 draft tokens → 17,180 accepted,整體接受率約 35%;position 0 接受率 69%(4920/7108),逐位遞減到 position 6 約 15%
                      • 目前 0 running / 0 waiting,KV 使用率 0%
                      • AITER:只啟用 UNIFIED_ATTENTION,其餘(MHA/MOE/MLA/RMSNORM/FP4BMM/FP8BMM)全關

                      Prefill(長 context 預填)速度:

                      prompt 長度 實際 tokens TTFT prefill 速度
                      8K 7,470 3.22s 2,319 tok/s
                      32K 29,742 11.49s 2,589 tok/s
                      64K 59,409 17.95s 3,311 tok/s
                      128K 118,772 45.52s 2,609 tok/s

                      Prefill 穩定在 2,300-3,300 tok/s,128K context 約 45 秒完成預填。

                      併發測試(每路 max 256 tok):

                      併發路數 wall time 總輸出 聚合速度 單路速度
                      1(先前) - 298 tok 41.5 tok/s 41.5
                      2 7.5s 459 tok 61.4 tok/s 29-34
                      4 8.7s 982 tok 113.5 tok/s 25-42
                      8 12.7s 1,941 tok 152.4 tok/s 27-42

                      實際在DSH的使用,單路思考時是很穩定在40 t/s左右,編程時會到70~80 t/s
                      ,比起llama.cpp + UD-Q4_K_XL 思考時25~40t/s,編程時50~75 t/s 效能好上不少。

                      kos orK 在线
                      kos orK 在线
                      kos or
                      技术大牛 劳动模范
                      编写于 最后由 编辑
                      #10

                      @paul-hou said:

                      2,319 tok/s

                      Prefill 這速度讓人訝異, 難道是 MXFP4 + DFlas2-FP8 有神奇效果 😍

                      paul houP 1 条回复 最后回复
                      0
                      • kos orK kos or

                        @paul-hou said:

                        2,319 tok/s

                        Prefill 這速度讓人訝異, 難道是 MXFP4 + DFlas2-FP8 有神奇效果 😍

                        paul houP 在线
                        paul houP 在线
                        paul hou
                        编写于 最后由 编辑
                        #11

                        @kos-or 有測試內建的MTP,結果就是9xx的prefill,30左右的decode,看來真的跟dflash2有關了。

                        1 条回复 最后回复
                        1

                        你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

                        厌倦了每次访问都刷到同样的帖子?您注册账号后,您每次返回时都能精准定位到您上次浏览的位置,并可选择接收新回复通知(通过邮件或推送通知)。您还能收藏书签、为帖子顶,向社区成员表达您的欣赏。

                        有了你的建议,这篇帖子会更精彩哦 💗

                        注册 登录
                        回复
                        • 在新帖中回复
                        登录后回复
                        • 从旧到新
                        • 从新到旧
                        • 最多赞同


                        • 登录

                        • 登录或注册以进行搜索。
                        • 第一个帖子
                          最后一个帖子
                        0
                        • 版块
                        • 最新
                        • 标签
                        • 热门
                        • 用户
                        • 群组