之前本地佈署都是靠著網站上的大神們的分享
這個假日測了整整二天VLLM,最終使用了這個方案,結果不錯分享一下。
https://github.com/magiccodingman/vllm-radiance
模型
- 主模型:/models/amd/Qwen3.8-27B-Quark-AWQ-MXFP4(served name: qwen3.8-27b-mxfp4)
- Draft 模型:/models/tcclaviger/Qwen3.8-27B-DFlash2-FP8
- 量化:MXFP4(W4A8),RADIANCE_MXFP4=1 + 全套 radiance 優化旗標(WPERM、HOIST_QUANT、EPIFAST、SKINNY_GEMM、R4D attention 等)
引擎參數
- tensor-parallel-size: 1(單卡 R9700 / gfx1201)
- gpu-memory-utilization: 0.98
- kv-cache-dtype: fp8,--kv-cache-memory 7,783,339,733 bytes(~7.3GB 固定分配)
- max-num-seqs: 8
- max-model-len: 163,840
- max-num-batched-tokens: 8,192
- attention-backend: R4D(+ RADIANCE_USE_R4D_GDN / R4D_AR / R4D_AR_QUANT)
- speculative decoding: dflash,num_speculative_tokens=7,TRITON_ATTN,disable_padded_drafter_batch
- mamba-cache-mode: align
- prefix caching: 啟用
- no-async-scheduling
- tool call: qwen3_xml parser;reasoning parser: qwen3
- override generation config: temperature 0.7 / top_p 0.95 / top_k 20
- chat template: qwen-fixed-v22.3.jinja(掛載為 /chat-template.jinja)
- language-model-only、trust-remote-code、HF_HUB_OFFLINE
實際運行狀態(/metrics)
- KV cache:288 blocks,共 180,098 tokens 容量,fp8
- prefix cache 命中率:1.85M / 2.44M ≈ 75.9%
- dflash spec decode:48,588 draft tokens → 17,180 accepted,整體接受率約 35%;position 0 接受率 69%(4920/7108),逐位遞減到 position 6 約 15%
- 目前 0 running / 0 waiting,KV 使用率 0%
- AITER:只啟用 UNIFIED_ATTENTION,其餘(MHA/MOE/MLA/RMSNORM/FP4BMM/FP8BMM)全關
Prefill(長 context 預填)速度:
| prompt 長度 | 實際 tokens | TTFT | prefill 速度 |
|---|---|---|---|
| 8K | 7,470 | 3.22s | 2,319 tok/s |
| 32K | 29,742 | 11.49s | 2,589 tok/s |
| 64K | 59,409 | 17.95s | 3,311 tok/s |
| 128K | 118,772 | 45.52s | 2,609 tok/s |
Prefill 穩定在 2,300-3,300 tok/s,128K context 約 45 秒完成預填。
併發測試(每路 max 256 tok):
| 併發路數 | wall time | 總輸出 | 聚合速度 | 單路速度 |
|---|---|---|---|---|
| 1(先前) | - | 298 tok | 41.5 tok/s | 41.5 |
| 2 | 7.5s | 459 tok | 61.4 tok/s | 29-34 |
| 4 | 8.7s | 982 tok | 113.5 tok/s | 25-42 |
| 8 | 12.7s | 1,941 tok | 152.4 tok/s | 27-42 |
實際在DSH的使用,單路思考時是很穩定在40 t/s左右,編程時會到70~80 t/s
,比起llama.cpp + UD-Q4_K_XL 思考時25~40t/s,編程時50~75 t/s 效能好上不少。
