vllm-radiance 測試報告 (2026/09/11)
https://github.com/magiccodingman/vllm-radiance
1. 已知問題與分析
在測試過程中發現兩個主要的功耗問題,皆導致待機功耗顯著增加:
- CPU 異常佔用:單核心會永久處於 100% 佔用狀態 → 導致待機功耗增加。
- GPU 異常佔用:開啟 MRV2 (DFlash2 必要條件) 後會觸發 GPU 100% 佔用 → 待機功耗從 10W 飆升至 70W。
2. 解決方案
針對上述問題,透過增加環境變數(Environment Variables)進行優化:
| 問題 | 解決方案 (環境變數) | 測試結果 |
|---|---|---|
| CPU 100% | HSA_TOOLS_DISABLE_REGISTER: "1" |
成功解決,且無明顯副作用 |
| GPU 100% | GPU_MAX_HW_QUEUES: "1" |
成功降低待機功耗至 13W,但會導致 DFlash2 性能下降 |
3. 實測數據分析
測試模型: qwen3.8-27b-mxfp4
硬體環境: AMD AI PRO R9700單卡
3.1 不同設定下的效能對比 (t/s)
| 測試配置 | 待機功耗 (GPU) | PP512 (t/s) | TG128 (t/s) | Peak TG (t/s) | 備註 |
|---|---|---|---|---|---|
| Baseline (預設) | 13W | 2056.40 | 19.51 | 20.00 | - |
| HSA_DISABLE=1 | 13W | 2056.93 | 19.51 | 20.00 | 解決 CPU 100% |
| DFlash2 + HSA_DISABLE=1 | 70W | 2077.81 | 46.40 | 61.50 | 效能最高,但功耗高 |
| DFlash2 + HSA_DISABLE=1 + GPU_MAX_HW_QUEUES=1 | 13W | 2055.15 | 36.34 | 45.00 | 功耗優化後,效能略降 |
| DFlash2 + HSA_DISABLE=1 + ROCBLAS_USE_HIPBLASLT=0 | 70W | 2032.20 | 20.67 | 31.00 | 效能低且功耗高 |
3.2 詳細數據表
| 配置組合 | PP512 t/s | TG128 t/s | Peak t/s | ttfr (ms) | e2e_ttft (ms) | GPU Idle |
|---|---|---|---|---|---|---|
DFLASH2 + HSA_DISABLE=1 |
2077.81 ± 1.46 | 46.40 ± 4.17 | 61.50 ± 4.50 | 43813.70 | 43815.38 | 70W |
DFLASH2 + HSA_DISABLE=1 + MAX_HW_QUEUES=1 |
2055.15 ± 6.53 | 36.34 ± 1.91 | 45.00 ± 3.00 | 44296.94 | 44300.34 | 13W |
DFLASH2 + HSA_DISABLE=1 + HIPBLASLT=0 |
2032.20 ± 1.61 | 20.67 ± 0.61 | 31.00 ± 1.00 | 44861.86 | 44863.42 | 70W |
HSA_DISABLE=1 (No DFlash2) |
2056.93 ± 2.15 | 19.51 ± 0.02 | 20.00 ± 0.00 | 44328.71 | 44330.32 | 13W |
Baseline |
2056.40 ± 0.29 | 19.51 ± 0.01 | 20.00 ± 0.00 | 44348.38 | 44352.21 | 13W |
3.3 原始數據
300 W vllm-radiance DFLASH2 HSA_TOOLS_DISABLE_REGISTER=1 GPU_MAX_HW_QUEUES=1 ROCBLAS_USE_HIPBLASLT=0 idle(GPU)=13W
| model | test | t/s | peak t/s | ttfr (ms) | est_ppt (ms) | e2e_ttft (ms) |
|---|---|---|---|---|---|---|
| qwen3.8-27b-mxfp4 | pp512 @ d100000 | 2012.15 ± 1.55 | 45313.23 ± 43.08 | 45311.95 ± 43.08 | 45314.89 ± 44.75 | |
| qwen3.8-27b-mxfp4 | tg128 @ d100000 | 20.27 ± 0.19 | 29.50 ± 3.50 |
300 W vllm-radiance DFLASH2 HSA_TOOLS_DISABLE_REGISTER=1 GPU_MAX_HW_QUEUES=1 idle=(GPU)13W
| model | test | t/s | peak t/s | ttfr (ms) | est_ppt (ms) | e2e_ttft (ms) |
|---|---|---|---|---|---|---|
| qwen3.8-27b-mxfp4 | pp512 @ d100000 | 2055.15 ± 6.53 | 44296.94 ± 149.44 | 44295.53 ± 149.44 | 44300.34 ± 149.92 | |
| qwen3.8-27b-mxfp4 | tg128 @ d100000 | 36.34 ± 1.91 | 45.00 ± 3.00 |
300 W vllm-radiance DFLASH2 HSA_TOOLS_DISABLE_REGISTER=1 idle(GPU)=70W
| model | test | t/s | peak t/s | ttfr (ms) | est_ppt (ms) | e2e_ttft (ms) |
|---|---|---|---|---|---|---|
| qwen3.8-27b-mxfp4 | pp512 @ d100000 | 2077.81 ± 1.46 | 43813.70 ± 108.09 | 43812.83 ± 108.09 | 43815.38 ± 106.41 | |
| qwen3.8-27b-mxfp4 | tg128 @ d100000 | 46.40 ± 4.17 | 61.50 ± 4.50 |
300 W vllm-radiance DFLASH2 HSA_TOOLS_DISABLE_REGISTER=1 ROCBLAS_USE_HIPBLASLT=0 idle(GPU)=70W
| model | test | t/s | peak t/s | ttfr (ms) | est_ppt (ms) | e2e_ttft (ms) |
|---|---|---|---|---|---|---|
| qwen3.8-27b-mxfp4 | pp512 @ d100000 | 2032.20 ± 1.61 | 44861.86 ± 6.43 | 44860.47 ± 6.43 | 44863.42 ± 4.87 | |
| qwen3.8-27b-mxfp4 | tg128 @ d100000 | 20.67 ± 0.61 | 31.00 ± 1.00 |
300 W vllm-radiance HSA_TOOLS_DISABLE_REGISTER=1 idle(GPU)=13W
| model | test | t/s | peak t/s | ttfr (ms) | est_ppt (ms) | e2e_ttft (ms) |
|---|---|---|---|---|---|---|
| qwen3.8-27b-mxfp4 | pp512 @ d100000 | 2056.93 ± 2.15 | 44328.71 ± 73.32 | 44327.61 ± 73.32 | 44330.32 ± 74.93 | |
| qwen3.8-27b-mxfp4 | tg128 @ d100000 | 19.51 ± 0.02 | 20.00 ± 0.00 |
300 W vllm-radiance idle(GPU)=13W
| model | test | t/s | peak t/s | ttfr (ms) | est_ppt (ms) | e2e_ttft (ms) |
|---|---|---|---|---|---|---|
| qwen3.8-27b-mxfp4 | pp512 @ d100000 | 2056.40 ± 0.29 | 44348.38 ± 9.51 | 44346.74 ± 9.51 | 44352.21 ± 9.77 | |
| qwen3.8-27b-mxfp4 | tg128 @ d100000 | 19.51 ± 0.01 | 20.00 ± 0.00 |
4. 結論與建議
- CPU 問題:建議永久加上
HSA_TOOLS_DISABLE_REGISTER: "1",可有效解決單核 100% 問題且不影響性能。 - GPU 功耗與效能權衡:
- 追求極致性能 開啟
DFlash2並接受70W 的待機功耗。 - 追求能效比/低功耗 開啟
DFlash2並搭配GPU_MAX_HW_QUEUES=1,可將待機功耗降至 13W,雖然 TG 速度從 46.4→36.34 t/s (下降約 21%),但仍遠高於未開啟 DFlash2 的狀態。
- 追求極致性能 開啟