跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 AI 广场
陳野狼陳

陳野狼

@陳野狼
取消关注 关注
关于
帖子
2
主题
0
分享
0
群组
0
粉丝
0
关注
0

帖子

最新 最佳 有争议的

  • 單張R9700 AI PRO 32G + VLLM + amd/Qwen3.8-27B-Quark-AWQ-MXFP4
    陳野狼陳 陳野狼

    vllm-radiance 測試報告 (2026/09/11)

    https://github.com/magiccodingman/vllm-radiance

    1. 已知問題與分析

    在測試過程中發現兩個主要的功耗問題,皆導致待機功耗顯著增加:

    • CPU 異常佔用:單核心會永久處於 100% 佔用狀態 → 導致待機功耗增加。
    • GPU 異常佔用:開啟 MRV2 (DFlash2 必要條件) 後會觸發 GPU 100% 佔用 → 待機功耗從 10W 飆升至 70W。

    2. 解決方案

    針對上述問題,透過增加環境變數(Environment Variables)進行優化:

    問題 解決方案 (環境變數) 測試結果
    CPU 100% HSA_TOOLS_DISABLE_REGISTER: "1" 成功解決,且無明顯副作用
    GPU 100% GPU_MAX_HW_QUEUES: "1" 成功降低待機功耗至 13W,但會導致 DFlash2 性能下降

    3. 實測數據分析

    測試模型: qwen3.8-27b-mxfp4
    硬體環境: AMD AI PRO R9700單卡

    3.1 不同設定下的效能對比 (t/s)

    測試配置 待機功耗 (GPU) PP512 (t/s) TG128 (t/s) Peak TG (t/s) 備註
    Baseline (預設) 13W 2056.40 19.51 20.00 -
    HSA_DISABLE=1 13W 2056.93 19.51 20.00 解決 CPU 100%
    DFlash2 + HSA_DISABLE=1 70W 2077.81 46.40 61.50 效能最高,但功耗高
    DFlash2 + HSA_DISABLE=1 + GPU_MAX_HW_QUEUES=1 13W 2055.15 36.34 45.00 功耗優化後,效能略降
    DFlash2 + HSA_DISABLE=1 + ROCBLAS_USE_HIPBLASLT=0 70W 2032.20 20.67 31.00 效能低且功耗高

    3.2 詳細數據表

    配置組合 PP512 t/s TG128 t/s Peak t/s ttfr (ms) e2e_ttft (ms) GPU Idle
    DFLASH2 + HSA_DISABLE=1 2077.81 ± 1.46 46.40 ± 4.17 61.50 ± 4.50 43813.70 43815.38 70W
    DFLASH2 + HSA_DISABLE=1 + MAX_HW_QUEUES=1 2055.15 ± 6.53 36.34 ± 1.91 45.00 ± 3.00 44296.94 44300.34 13W
    DFLASH2 + HSA_DISABLE=1 + HIPBLASLT=0 2032.20 ± 1.61 20.67 ± 0.61 31.00 ± 1.00 44861.86 44863.42 70W
    HSA_DISABLE=1 (No DFlash2) 2056.93 ± 2.15 19.51 ± 0.02 20.00 ± 0.00 44328.71 44330.32 13W
    Baseline 2056.40 ± 0.29 19.51 ± 0.01 20.00 ± 0.00 44348.38 44352.21 13W

    3.3 原始數據

    300 W vllm-radiance DFLASH2 HSA_TOOLS_DISABLE_REGISTER=1 GPU_MAX_HW_QUEUES=1 ROCBLAS_USE_HIPBLASLT=0 idle(GPU)=13W

    model test t/s peak t/s ttfr (ms) est_ppt (ms) e2e_ttft (ms)
    qwen3.8-27b-mxfp4 pp512 @ d100000 2012.15 ± 1.55 45313.23 ± 43.08 45311.95 ± 43.08 45314.89 ± 44.75
    qwen3.8-27b-mxfp4 tg128 @ d100000 20.27 ± 0.19 29.50 ± 3.50

    300 W vllm-radiance DFLASH2 HSA_TOOLS_DISABLE_REGISTER=1 GPU_MAX_HW_QUEUES=1 idle=(GPU)13W

    model test t/s peak t/s ttfr (ms) est_ppt (ms) e2e_ttft (ms)
    qwen3.8-27b-mxfp4 pp512 @ d100000 2055.15 ± 6.53 44296.94 ± 149.44 44295.53 ± 149.44 44300.34 ± 149.92
    qwen3.8-27b-mxfp4 tg128 @ d100000 36.34 ± 1.91 45.00 ± 3.00

    300 W vllm-radiance DFLASH2 HSA_TOOLS_DISABLE_REGISTER=1 idle(GPU)=70W

    model test t/s peak t/s ttfr (ms) est_ppt (ms) e2e_ttft (ms)
    qwen3.8-27b-mxfp4 pp512 @ d100000 2077.81 ± 1.46 43813.70 ± 108.09 43812.83 ± 108.09 43815.38 ± 106.41
    qwen3.8-27b-mxfp4 tg128 @ d100000 46.40 ± 4.17 61.50 ± 4.50

    300 W vllm-radiance DFLASH2 HSA_TOOLS_DISABLE_REGISTER=1 ROCBLAS_USE_HIPBLASLT=0 idle(GPU)=70W

    model test t/s peak t/s ttfr (ms) est_ppt (ms) e2e_ttft (ms)
    qwen3.8-27b-mxfp4 pp512 @ d100000 2032.20 ± 1.61 44861.86 ± 6.43 44860.47 ± 6.43 44863.42 ± 4.87
    qwen3.8-27b-mxfp4 tg128 @ d100000 20.67 ± 0.61 31.00 ± 1.00

    300 W vllm-radiance HSA_TOOLS_DISABLE_REGISTER=1 idle(GPU)=13W

    model test t/s peak t/s ttfr (ms) est_ppt (ms) e2e_ttft (ms)
    qwen3.8-27b-mxfp4 pp512 @ d100000 2056.93 ± 2.15 44328.71 ± 73.32 44327.61 ± 73.32 44330.32 ± 74.93
    qwen3.8-27b-mxfp4 tg128 @ d100000 19.51 ± 0.02 20.00 ± 0.00

    300 W vllm-radiance idle(GPU)=13W

    model test t/s peak t/s ttfr (ms) est_ppt (ms) e2e_ttft (ms)
    qwen3.8-27b-mxfp4 pp512 @ d100000 2056.40 ± 0.29 44348.38 ± 9.51 44346.74 ± 9.51 44352.21 ± 9.77
    qwen3.8-27b-mxfp4 tg128 @ d100000 19.51 ± 0.01 20.00 ± 0.00

    4. 結論與建議

    1. CPU 問題:建議永久加上 HSA_TOOLS_DISABLE_REGISTER: "1",可有效解決單核 100% 問題且不影響性能。
    2. GPU 功耗與效能權衡:
      • 追求極致性能 開啟 DFlash2 並接受70W 的待機功耗。
      • 追求能效比/低功耗 開啟 DFlash2 並搭配 GPU_MAX_HW_QUEUES=1,可將待機功耗降至 13W,雖然 TG 速度從 46.4→36.34 t/s (下降約 21%),但仍遠高於未開啟 DFlash2 的狀態。
    LLM讨论区 r9700 vllm qwen-27b

  • 單張R9700 AI PRO 32G + VLLM + amd/Qwen3.8-27B-Quark-AWQ-MXFP4
    陳野狼陳 陳野狼

    @paul-hou

    請問一下我只要開 MRV2(VLLM_USE_V2_MODEL_RUNNER) 待機 GPU 100% 瓦數 70W 但是測速等等都正常
    (CPU也會100% 加HSA_TOOLS_DISABLE_REGISTER=1 就解決CPU 100%)
    待機 GPU 100%是正常的嗎????
    沒開MRV2 待機 GPU 0% 瓦數 12W

    MRV2 DFlash Async Idle GFX
    OFF OFF 任意 0%
    ON OFF ON/OFF 100%
    ON ON 任意 100%

    240 W vllm-radiance DFLASH2

    model test t/s peak t/s ttfr (ms) est_ppt (ms) e2e_ttft (ms)
    qwen3.8-27b-mxfp4 pp512 @ d100000 1936.29 ± 0.00 47053.08 ± 0.00 47051.81 ± 0.00 47056.48 ± 0.00
    qwen3.8-27b-mxfp4 tg128 @ d100000 61.57 ± 0.00 69.00 ± 0.00

    240 W vllm-radiance

    model test t/s peak t/s ttfr (ms) est_ppt (ms) e2e_ttft (ms)
    qwen3.8-27b-mxfp4 pp512 @ d100000 1927.44 ± 0.00 47275.50 ± 0.00 47274.08 ± 0.00 47275.50 ± 0.00
    qwen3.8-27b-mxfp4 tg128 @ d100000 18.48 ± 0.00 19.00 ± 0.00

    .env 如下
    IMAGE=magiccodingman/vllm-radiance:latest
    MODELS=/home/mark/models
    VLLM_CACHE=./vllm-cache
    PORT=8090

    TP=1
    HIP_VISIBLE_DEVICES=0
    GPU_UTIL=0.98

    MODEL_PATH=/models/Qwen3.8-27B-MXFP4-mtpfp8
    SERVED_MODEL_NAME=qwen3.8-27b-mxfp4
    WEIGHT_QUANTIZATION=auto

    KV_CACHE_DTYPE=fp8
    MAX_MODEL_LEN=131072
    MAX_NUM_SEQS=8
    MAX_NUM_BATCHED_TOKENS=8192
    MAMBA_CACHE_MODE=align

    RADIANCE_MXFP4=1
    RADIANCE_MXFP4_W4A8=1
    RADIANCE_MXFP4_W4A8_MIN_M=0
    RADIANCE_MXFP4_DECODE_MAX_M=64
    RADIANCE_MXFP4_TN4_MIN_M=2048
    RADIANCE_MXFP4_WPERM=1
    RADIANCE_MXFP4_DECODE_NT=1

    RADIANCE_HOIST_QUANT=1
    RADIANCE_EPIFAST=1
    RADIANCE_SKINNY_GEMM=1

    ATTENTION_BACKEND=R4D
    RADIANCE_USE_R4D_GDN=1
    RADIANCE_USE_R4D_AR=1
    RADIANCE_USE_R4D_AR_QUANT=1

    AITER_UNIFIED_ATTENTION=1
    AITER_EXTRA_MHA=0
    AITER_EXTRA_MOE=0
    AITER_EXTRA_MLA=0
    AITER_EXTRA_RMSNORM=0
    AITER_EXTRA_FP4BMM=0
    AITER_EXTRA_FP8BMM=0

    VLLM_USE_V2_MODEL_RUNNER=1
    RADIANCE_COMPILATION_CONFIG='{"cudagraph_mode":"PIECEWISE"}'
    RADIANCE_FAST_DRAFT=1
    RADIANCE_SPECULATIVE_CONFIG='{"method":"dflash","model":"/models/Qwen3.8-27B-DFlash2-FP8","num_speculative_tokens":7,"draft_tensor_parallel_size":1,"attention_backend":"TRITON_ATTN","max_model_len":131072,"disable_padded_drafter_batch":true}'

    LLM讨论区 r9700 vllm qwen-27b
  • 登录

  • 登录或注册以进行搜索。
  • 第一个帖子
    最后一个帖子
0
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组