X99 Dual 7900 XTX + DFlash Qwen3.6-27B 實測
-
X99 Dual 7900 XTX + DFlash Qwen3.6-27B 實測

硬體: X99底板 + 2張 AMD RX 7900 XTX 顯示卡 (每張24GB RAM) + ROCm 7.2.3
模型: Qwen3.6-27B Q4_K_M (~16GB,官方原版)
加速模型: dflash-draft-3.6-q8_0 (~1.8GB)
框架: DFlash (lucebox-hub)乜嘢係 DFlash?
想像你打字好慢,但身邊有個助手(Draft 模型)可以幫你估你會打乜,你每次出 1 個字,佢就估下一句 10 個字。你只需睇一眼確認啱唔啱,啱就跳過 — 唔使逐個字打,咁就快好多。
呢個就係「speculative decode」嘅概念。
花咗好多時間發現嘅重點
DFlash 入面有啲叫「Phase 2」嘅加速 kernel,第一次 compile 嗰陣唔小心關咗,搞到慢咗成 1.7 倍。要手動開返先正常。
速度結果
普通模式(兩張卡分工)
• 測試模式: 普通模式(兩張卡分工)
• 記憶長度: 4K
• 速度: 18 tokens/s
• 對比普通模式: 1.00x(基準)
DFlash 加速(最佳設定)
• 測試模式: DFlash 加速(最佳設定)
• 記憶長度: 4K
• 速度: 52 tokens/s
• 對比普通模式: 2.88x

DFlash 加速
• 測試模式: DFlash 加速
• 記憶長度: 128K
• 速度: 50 tokens/s
• 對比普通模式: 2.79x
DFlash 加速
• 測試模式: DFlash 加速
• 記憶長度: 256K
• 速度: 50 tokens/s
• 對比普通模式: 2.77x
有幾快? 普通模式每秒出 18 個字,開 DFlash 後每秒出 50 個字,快差唔多 3 倍。
256K 長度係幾多? 大約等於半本《三體》嘅長度。就算模型要記咁多嘢,速度都幾乎冇跌(51 → 50 tokens/s),只慢 4%。
技術用語解碼
- Token = AI 模型嘅「字詞單位」,一個中文字大約 1-2 個 token
- tok/s (tokens per second) = 每秒生成幾多個字,越高越快
- Context / ctx = 模型記得幾多內容,256K ≈ 約 20 萬中文字
- GGUF = 模型檔案格式,類似 .mp4 但係俾 AI 用
- ROCm = AMD 版嘅 CUDA,俾顯示卡做 AI 計算
- q4_0 = 壓縮率,將 16GB 模型壓細嘅程度,q4_0 用 4-bit 儲存,慳位又快
- AR baseline (Autoregressive) = 普通逐個字生成模式,最慢但最穩
- Budget = DFlash 助手每次幫你估幾多個字,10 係最理想
- Draft-feature-mirror = 一個「對齊」功能,令助手嘅估算更加準確,快多 30%
- Dual-split = 兩張卡各做一半運算,分擔 workload
最佳指令(for 技術讀者)
./build/test_dflash <target.gguf> <draft.gguf> <prompt.bin> 512 <out.bin>
--ddtree --ddtree-budget=10 --fast-rollback
--target-gpu=0 --draft-gpu=1
-ctv q4_0 -ctk q4_0
--max-ctx=262144 --draft-feature-mirror -
我竟然需要翻译才能仔细看你在说什么。顶。来点实测的截图。谢谢。
-
我竟然需要翻译才能仔细看你在说什么。顶。来点实测的截图。谢谢。