跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 AI 广场
  1. 主页
  2. 版块
  3. LLM讨论区
  4. 單張R9700 AI PRO 32G + VLLM + amd/Qwen3.8-27B-Quark-AWQ-MXFP4

單張R9700 AI PRO 32G + VLLM + amd/Qwen3.8-27B-Quark-AWQ-MXFP4

已定时 已固定 已锁定 已移动 LLM讨论区
r9700vllmqwen-27b
11 帖子 5 发布者 143 浏览
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • paul houP 在线
    paul houP 在线
    paul hou
    编写于 最后由 编辑
    #2

    補充一下,OS是CACHYOS,關閉所有圖形介面後,開機VRAM只佔65M。

    1 条回复 最后回复
    0
    • L 在线
      L 在线
      linghu007
      编写于 最后由 编辑
      #3

      多谢分享,但我试了,同样参数我显存不够(大概多了2g),我开机100M显存占用。

      1 条回复 最后回复
      0
      • paul houP 在线
        paul houP 在线
        paul hou
        编写于 最后由 paul hou 编辑
        #4

        我是純LLM SERVER的方式在用,所以可以壓榨所有的VRAM來使用,另外是放棄了多模態沒上載入。二併發的情況下還是滿好用的。
        這套99.9%都是HERMES+DSV4F安裝好的,那2G應該可以想辦法搞出來。
        DSH新會話大約是3秒就開始動作,所以PREFILL是破3000的,這是我用這個的重點。

        1225f3f2-cf51-4b23-9959-f10088fdb83b-image.jpeg

        1 条回复 最后回复
        1
        • A 离线
          A 离线
          andyfay
          编写于 最后由 编辑
          #5

          用这个模型建议两张R9700,单流速度150以上

          1 条回复 最后回复
          0
          • paul houP 在线
            paul houP 在线
            paul hou
            编写于 最后由 编辑
            #6

            電費,設備,預算,使用情境,老婆的臉色,目前只支持一張R9700。

            zhenyu huangZ 1 条回复 最后回复
            0
            • paul houP paul hou

              電費,設備,預算,使用情境,老婆的臉色,目前只支持一張R9700。

              zhenyu huangZ 离线
              zhenyu huangZ 离线
              zhenyu huang
              编写于 最后由 编辑
              #7

              @paul-hou profill速度怎么那么快 是因为量化等级小吗

              zhenyu huangZ 1 条回复 最后回复
              1
              • zhenyu huangZ zhenyu huang

                @paul-hou profill速度怎么那么快 是因为量化等级小吗

                zhenyu huangZ 离线
                zhenyu huangZ 离线
                zhenyu huang
                编写于 最后由 编辑
                #8

                还是前缀缓存命中了?

                1 条回复 最后回复
                0
                • paul houP 在线
                  paul houP 在线
                  paul hou
                  编写于 最后由 编辑
                  #9

                  不確定是dflash2有加快,還是整個vllm設定和amd自己量化的模型有特別的優化,過程中裝了三種vllm,確實另外二個就是1200左右的prefill,decode 還有慢到只有15左右的。

                  今天整天用下來比之前用vulkan + Q6或Q4快很多,不過2併發的編程就不用想了,run2只能做很簡單的小事,不然會整體拖慢速度。

                  1 条回复 最后回复
                  0
                  • paul houP paul hou

                    之前本地佈署都是靠著網站上的大神們的分享
                    這個假日測了整整二天VLLM,最終使用了這個方案,結果不錯分享一下。

                    https://github.com/magiccodingman/vllm-radiance

                    模型

                    • 主模型:/models/amd/Qwen3.8-27B-Quark-AWQ-MXFP4(served name: qwen3.8-27b-mxfp4)
                    • Draft 模型:/models/tcclaviger/Qwen3.8-27B-DFlash2-FP8
                    • 量化:MXFP4(W4A8),RADIANCE_MXFP4=1 + 全套 radiance 優化旗標(WPERM、HOIST_QUANT、EPIFAST、SKINNY_GEMM、R4D attention 等)

                    引擎參數

                    • tensor-parallel-size: 1(單卡 R9700 / gfx1201)
                    • gpu-memory-utilization: 0.98
                    • kv-cache-dtype: fp8,--kv-cache-memory 7,783,339,733 bytes(~7.3GB 固定分配)
                    • max-num-seqs: 8
                    • max-model-len: 163,840
                    • max-num-batched-tokens: 8,192
                    • attention-backend: R4D(+ RADIANCE_USE_R4D_GDN / R4D_AR / R4D_AR_QUANT)
                    • speculative decoding: dflash,num_speculative_tokens=7,TRITON_ATTN,disable_padded_drafter_batch
                    • mamba-cache-mode: align
                    • prefix caching: 啟用
                    • no-async-scheduling
                    • tool call: qwen3_xml parser;reasoning parser: qwen3
                    • override generation config: temperature 0.7 / top_p 0.95 / top_k 20
                    • chat template: qwen-fixed-v22.3.jinja(掛載為 /chat-template.jinja)
                    • language-model-only、trust-remote-code、HF_HUB_OFFLINE

                    實際運行狀態(/metrics)

                    • KV cache:288 blocks,共 180,098 tokens 容量,fp8
                    • prefix cache 命中率:1.85M / 2.44M ≈ 75.9%
                    • dflash spec decode:48,588 draft tokens → 17,180 accepted,整體接受率約 35%;position 0 接受率 69%(4920/7108),逐位遞減到 position 6 約 15%
                    • 目前 0 running / 0 waiting,KV 使用率 0%
                    • AITER:只啟用 UNIFIED_ATTENTION,其餘(MHA/MOE/MLA/RMSNORM/FP4BMM/FP8BMM)全關

                    Prefill(長 context 預填)速度:

                    prompt 長度 實際 tokens TTFT prefill 速度
                    8K 7,470 3.22s 2,319 tok/s
                    32K 29,742 11.49s 2,589 tok/s
                    64K 59,409 17.95s 3,311 tok/s
                    128K 118,772 45.52s 2,609 tok/s

                    Prefill 穩定在 2,300-3,300 tok/s,128K context 約 45 秒完成預填。

                    併發測試(每路 max 256 tok):

                    併發路數 wall time 總輸出 聚合速度 單路速度
                    1(先前) - 298 tok 41.5 tok/s 41.5
                    2 7.5s 459 tok 61.4 tok/s 29-34
                    4 8.7s 982 tok 113.5 tok/s 25-42
                    8 12.7s 1,941 tok 152.4 tok/s 27-42

                    實際在DSH的使用,單路思考時是很穩定在40 t/s左右,編程時會到70~80 t/s
                    ,比起llama.cpp + UD-Q4_K_XL 思考時25~40t/s,編程時50~75 t/s 效能好上不少。

                    kos orK 离线
                    kos orK 离线
                    kos or
                    技术大牛 劳动模范
                    编写于 最后由 编辑
                    #10

                    @paul-hou said:

                    2,319 tok/s

                    Prefill 這速度讓人訝異, 難道是 MXFP4 + DFlas2-FP8 有神奇效果 😍

                    paul houP 1 条回复 最后回复
                    0
                    • kos orK kos or

                      @paul-hou said:

                      2,319 tok/s

                      Prefill 這速度讓人訝異, 難道是 MXFP4 + DFlas2-FP8 有神奇效果 😍

                      paul houP 在线
                      paul houP 在线
                      paul hou
                      编写于 最后由 编辑
                      #11

                      @kos-or 有測試內建的MTP,結果就是9xx的prefill,30左右的decode,看來真的跟dflash2有關了。

                      1 条回复 最后回复
                      1

                      你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

                      厌倦了每次访问都刷到同样的帖子?您注册账号后,您每次返回时都能精准定位到您上次浏览的位置,并可选择接收新回复通知(通过邮件或推送通知)。您还能收藏书签、为帖子顶,向社区成员表达您的欣赏。

                      有了你的建议,这篇帖子会更精彩哦 💗

                      注册 登录
                      回复
                      • 在新帖中回复
                      登录后回复
                      • 从旧到新
                      • 从新到旧
                      • 最多赞同


                      • 登录

                      • 登录或注册以进行搜索。
                      • 第一个帖子
                        最后一个帖子
                      0
                      • 版块
                      • 最新
                      • 标签
                      • 热门
                      • 用户
                      • 群组