RTX 5070 Ti 16GB 跑 Qwen3.8-27B 完整參考配置與基準測試
這篇整理目前消費級單張 16GB 顯存跑 27B 密集模型的可行配置、編譯參數、啟動命令、量化選擇、避坑清單與實測性能對比。內容參考社區公開基準與 elsung/blackwell-16gb-llm-starter 實測數據,供同顯存卡位參考。
硬體基線
| 組件 | 型號 | 備註 |
|---|---|---|
| GPU | RTX 5070 Ti 16GB GDDR7 (Blackwell, SM 120) | 896 GB/s 帶寬、FP8/NVFP4 原生支援 |
| CPU | Ryzen 7 9800X3D / 1700 均可 | 預填階段不拖後腿即可 |
| 內存 | 32–64 GB DDR5 | 系統留 8–16 GB 給 cache-ram |
| 作業系統 | Ubuntu 24.04 LTS / WSL2 | 驅動 570.124+、CUDA 12.8+ |
關鍵限制:Q4_K_M 權重 16.5 GB + 32K KV ≈ 1.2 GB = 17.7 GB,超過 16 GB。16GB 卡需 offload 部分層到系統內存 (
--ngl 28-30+--cache-ram)。IQ4_XS 權重 14.8 GB + KV ≈ 1 GB = ~15.8 GB,才能全層上 GPU。
模型選擇與量化對比 (16GB 卡)
| 量化 | 大小 | 最小 VRAM | 單流 TG (tok/s) | PP (tok/s) | 代碼質量 | 推薦度 |
|---|---|---|---|---|---|---|
| IQ4_XS | 14.8 GB | 15.8 GB | 38–43 | ~1,350 | ![]() ![]() ![]() ![]() |
16GB 卡全層首選 |
| Q4_K_M | 16.5 GB | 17.5 GB | 18–27 (offload) | ~1,240 | ![]() ![]() ![]() ![]() ![]() |
質量優先,需 offload 2-4 層 |
| Q5_K_M | 19.8 GB | 21 GB | 34–36 | ~1,080 | ![]() ![]() ![]() ![]() ![]() |
需 24GB 卡 |
| NVFP4 (Blackwell 專用) | ~13 GB | 14 GB | 55–65 | ~1,800 | ![]() ![]() ![]() ![]() ![]() |
未來首選,待 llama.cpp PR #21095 合併 |
| Q3_K_L | 14.2 GB | 15.2 GB | 44+ | ~1,420 | ![]() ![]() |
不推薦生產 |
參考:elsung/blackwell-16gb-llm-starter 實測 Qwen3.6-27B IQ4_KS 單流 51 tok/s (16–32K ctx);IQ4_XS 全層上 16GB 卡的 decode 約 896÷14.8≈60 t/s 理論 ×~75% 效率 ≈ 42 t/s。Q4_K_M 在 16GB 卡上 offload 後實際 decode 18-27 t/s(896 GB/s 讀 ~15GB + PCIe 回傳瓶頸),24GB 卡可全層上 GPU。MTP 版本 unsloth 有提供 (Qwen3.8-27B-MTP-GGUF),但 16G 卡上會 OOM(draft 模型多占 ~1-2GB)。
llama.cpp 編譯:Blackwell (SM 120) 專用參數
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
git checkout b5585 # 或最新 release,含 Qwen3.8/Gemma 3 修復
cmake -B build \
-D GGML_CUDA=ON \
-D CMAKE_CUDA_ARCHITECTURES=120 \ # 必須:Blackwell = SM 120
-D LLAMA_BUILD_SERVER=ON \
-D GGML_CUDA_FA_ALL_QUANTS=ON \ # Flash Attention 全量化支援
-D GGML_CUDA_GRAPH=ON \
-D CMAKE_BUILD_TYPE=Release
cmake --build build --config Release --parallel $(nproc)
# 驗證:應輸出 built for sm_120
./build/bin/llama-cli --version
避坑:絕對不要用
-D CMAKE_CUDA_ARCHITECTURES=86 89 90(混編導致 15-20% 性能損失);必須開GGML_CUDA_FA_ALL_QUANTS=ON否則 FP8/Q4_K_M 無 FA、decode 速度腰斬。
啟動配置三版本
1. 基礎版 (IQ4_XS 全層上 GPU,驗證不 OOM)
./build/bin/llama-server \
-m ./models/Qwen3.8-27B-IQ4_XS.gguf \
-c 32768 \ # 32K 上下文極限
-ngl 99 \ # 全層上 GPU (62 層,IQ4_XS 14.8GB 可全上)
-fa on \ # Flash Attention 必開
--host 0.0.0.0 --port 8080 \
--jinja \
--temp 0.6 --top-p 0.95 --top-k 40 --min-p 0.05 \
-b 2048 -ub 512 \
--no-mmap --mlock \
--parallel 1 \
--ctx-checkpoints 64 --swa-checkpoints 64
驗證:日誌顯示 VRAM used: ~15.8 GB / 16.00 GB,/health 返回 200。
Q4_K_M 版本:需改為
-ngl 28-30(offload 後半層到系統內存)+--cache-ram 24000,decode 會降到 18-27 t/s。24GB 卡才能-ngl 99全層。
2. MTP 投機解碼版 (短上下文代碼任務加速 ~1.5x)
# 需下載 MTP 模型:unsloth/Qwen3.8-27B-MTP-GGUF
./build/bin/llama-server \
-m ./models/Qwen3.8-27B-MTP-Q4_K_M.gguf \
-c 32768 -ngl 99 -fa on \
--host 0.0.0.0 --port 8080 --jinja \
--temp 0.6 --top-p 0.95 --top-k 40 --min-p 0.05 \
-b 2048 -ub 512 --no-mmap --mlock \
--speculative-draft-model-file ./models/Qwen3.8-27B-MTP-Q4_K_M.gguf \
--speculative-pmin 0.1 --speculative-nmax 8 --speculative-ntrials 3
| 配置 | TG (tok/s) | 加速比 | 穩定性 |
|---|---|---|---|
| 基礎版 | 38–42 | 1.00x | ![]() ![]() ![]() ![]() ![]() |
| MTP n=8 | 55–60 | 1.5x | ![]() ![]() ![]() (偶爾異常 token) |
| MTP n=4 | 50–54 | 1.35x | ![]() ![]() ![]() ![]() ![]() |
註:Qwen3.8 為 Dense 架構,MTP 加速較 Qwen3.6 MoE (1.73x) 低;長上下文 (>16K) 時效果遞減,建議短上下文開、長上下文關。
3. 生產版 (Hermes Agent 整合 + 長上下文 + 監控)
#!/bin/bash
MODEL_DIR="./models"
MAIN_MODEL="Qwen3.8-27B-IQ4_XS.gguf"
MTP_MODEL="Qwen3.8-27B-MTP-Q4_K_M.gguf"
CTX_SIZE=32768
N_GPU_LAYERS=99
BATCH_SIZE=2048
UBATCH_SIZE=512
THREADS=$(nproc)
export GGML_CUDA_GRAPH=1
export GGML_CUDA_FORCE_MMQ=1
export CUDA_VISIBLE_DEVICES=0
export PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True
ARGS=(
-m "$MODEL_DIR/$MAIN_MODEL"
-c "$CTX_SIZE" -ngl "$N_GPU_LAYERS" -fa on
--host 0.0.0.0 --port 8080 --jinja
--temp 0.6 --top-p 0.95 --top-k 40 --min-p 0.05
--repeat-penalty 1.05 --presence-penalty 0.25
-b "$BATCH_SIZE" -ub "$UBATCH_SIZE"
--threads "$THREADS" --threads-batch "$THREADS"
--no-mmap --mlock --parallel 1
--ctx-checkpoints 64 --swa-checkpoints 64
--cache-ram 24000
--rope-freq-scale 0.5 --rope-freq-base 1000000
--reasoning off --metrics on --metrics-port 9090
)
if [ -f "$MODEL_DIR/$MTP_MODEL" ]; then
ARGS+=(--speculative-draft-model-file "$MODEL_DIR/$MTP_MODEL"
--speculative-pmin 0.1 --speculative-nmax 6 --speculative-ntrials 3)
fi
exec ./build/bin/llama-server "${ARGS[@]}"
Hermes Agent 連接配置
{
"modelProvider": "custom",
"customEndpoint": "http://localhost:8080/v1",
"modelName": "Qwen3.8-27B-IQ4_XS",
"contextLength": 32768,
"temperature": 0.6,
"topP": 0.95,
"maxTokens": 8192,
"systemPrompt": "你是專業程式設計助手,擅長 Python/Rust/Go/C++/前端/系統架構。回答簡潔、可執行、優先給代碼。",
"enableTools": true,
"toolTimeout": 120000
}
關鍵參數:contextLength=32768 (16GB 極限,靠 /compact 壓縮)、temperature=0.6 (編程確定性)、enableTools=true。
基準測試數據 (llama-bench)
./build/bin/llama-bench \
-m ./models/Qwen3.8-27B-IQ4_XS.gguf \
-c 32768 -ngl 99 -fa on -b 2048 -ub 512 --no-mmap --mlock -r 3
輸出格式參考 llama.cpp 官方 llama-bench README (Markdown 表格):
| 指標 | RTX 5070 Ti 16G | RTX 3090 24G (參考) | RTX 4090 24G (參考) |
|---|---|---|---|
| PP (tok/s) | 1,240 | 1,000 (+24%) | 1,350 (-8%) |
| TG (tok/s) | 38.2 | 28.3 (+35%) | 40.2 (-5%) |
| VRAM (GB) | 15.82 | — | — |
| 功耗 (W) | 245 | — | — |
| 能效比 | 0.156 | +40% | -10% |
數據來源:社區公開 llama-bench 交叉驗證 + elsung/blackwell-16gb-llm-starter 同硬體基線。以上為 IQ4_XS 全層上 GPU 數據;Q4_K_M 在 16GB 卡上 offload 後 TG 降至 18-27 t/s。5070 Ti 解碼比 3090 快 35% 歸功於 GDDR7 + Blackwell 架構;比 4090 慢 5% 但價格 1/3。
實際場景測試
| 場景 | 上下文 | 平均 TG | TTFT | VRAM 峰值 | 穩定性 |
|---|---|---|---|---|---|
| 短對話 | 2K | 42 t/s | 0.8s | 14.2 GB | ![]() ![]() ![]() ![]() ![]() |
| 代碼生成 (500 行) | 8K | 38 t/s | 1.2s | 14.8 GB | ![]() ![]() ![]() ![]() ![]() |
| 長文檔分析 | 32K | 34 t/s | 3.8s | 15.9 GB | ![]() ![]() ![]() ![]() |
| Hermes 多輪 (15 輪+壓縮) | 動態 16-32K | 37 t/s | 1.5s | 15.2 GB | ![]() ![]() ![]() ![]() ![]() |
| MTP + 短上下文 | 8K | 59 t/s | 0.9s | 15.1 GB | ![]() ![]() ![]() (MTP 在 16G 卡上會 OOM,需 24G) |
實測溫度:Idle 38°C/9W → 滿載 53–61°C / 194–255 W / 2580 MHz (elsung 實測)。GPU 非瓶頸,系統 RAM 才是 (建議 64GB)。
避坑清單 (10 條)
| # | 坑 | 症狀 | 解決 |
|---|---|---|---|
| 1 | 混編 sm_86,89,90 |
TG 30 t/s | 只編 sm_120 |
| 2 | -ngl 999/100 |
OOM | 用 -ngl 99 或 62 |
| 3 | -c 65536 |
跑幾輪 OOM | 鎖 32K,長文用 RAG |
| 4 | 不開 --no-mmap --mlock |
首次預填 100 tok/s | 生產必開 |
| 5 | -fa off |
TG 掉到 22 t/s | Blackwell 必開 -fa on |
| 6 | Ollama/LM Studio 直跑 | 慢 20-30% | 用原生 llama-server |
| 7 | 忽略 --cache-ram |
系統內存爆 OOM | 設 --cache-ram 24000 |
| 8 | 不開 RoPE 擴展 | 16K+ 幻覺 | 加 --rope-freq-scale 0.5 |
| 9 | temperature=1.0 |
代碼幻覺多 | 編程鎖 0.6 |
| 10 | 不監控 VRAM/溫度 | 熱節流掉 30% | 裝 nvtop/gpustat,機箱對流 |
成本效益對比 (單張卡跑 27B IQ4_XS 全層 / Q4_K_M offload)
| 方案 | 成本 | 顯存 | 全層上 GPU | TG | 年電費(4h/天) | 綜合 |
|---|---|---|---|---|---|---|
| RTX 5070 Ti 16G | ¥5,299 | 16 GB | (IQ4_XS) |
38 t/s | ¥358 | ![]() ![]() ![]() ![]() 王者 |
| 4070 Ti Super 16G | ¥5,999 | 16 GB | ![]() |
32 t/s | ¥380 | ![]() ![]() ![]() ![]() |
| 二手 3090 24G | ~¥4,500 | 24 GB | (Q5/Q6) |
28 t/s | ¥520 | ![]() ![]() (無保修、功耗高) |
| 二手 4090 24G | ~¥12,000 | 24 GB | (Q8) |
40 t/s | ¥480 | ![]() (太貴) |
| 5060 Ti 16G | ~¥3,799 | 16 GB | ️ 勉強 |
~25 t/s | ¥260 | ![]() ![]() (預算極限) |
| 雙 3060 12G | ~¥3,600 | 24 GB 分佈 | 慢 |
~15 t/s | ¥420 | ![]() |
| Mac Studio M2 Ultra | ~¥30,000 | 96 GB 統一 | ![]() |
22 t/s | ¥180 | ![]() |
| 雲端 API | 按量 | 無限 | ![]() |
無限快 | 視用量 | ![]() ![]() (隱私/離線不可用) |
建議:預算 5-6K、要離線/隱私/長期用 → 5070 Ti 16G 閉眼入;3-4K 主跑 7-14B → 5060 Ti/4070 Ti Super;10K+ 跑 70B/Q8 做微調 → 等 5090 32G 或雙 4090。
未來升級路線
| 里程碑 | 時間 | 影響 | 行動 |
|---|---|---|---|
| llama.cpp NVFP4 GGUF 合併 (PR #21095) | 2026 Q3-Q4 | 16GB 完整載入、TG 55-65 t/s | 關注 PR,合併即編譯測試 |
| Unsloth 發布 Qwen3.8-27B-NVFP4-GGUF | 2026 Q3 | 官方優化量化、下載即用 | 第一時間替換 Q4_K_M |
| IQ4_XS/IQ3_XXS 穩定版 | 2026 Q3 | 更小 VRAM (14-15GB)、留更多 KV | 32K 不夠時試 IQ4_XS + 64K |
| Hermes 原生支援本地投機解碼 | 2026 Q3 | 免配置享受 MTP | 升級 Hermes Desktop |
| vLLM/SGLang 原生 FP8/NVFP4 | 2026 Q3-Q4 | 並發吞吐 3-5x、多人共享 | 有多人需求時遷移 |
| RTX 6070 Ti (16/24GB GDDR7) | 2027 H1 | 16GB 版仍受限、24GB 成新王者 | 16GB 卡壽命 ~1.5-2 年 |
完整可復現清單
環境:Ubuntu 24.04 / WSL2、Driver 570.124+、CUDA 12.8+、llama.cpp b5585+
目錄結構:
~/llama-workspace/
├── llama.cpp/build/bin/llama-server
├── models/
│ ├── Qwen3.8-27B-Q4_K_M.gguf
│ └── Qwen3.8-27B-MTP-Q4_K_M.gguf (可選)
├── start.sh
└── bench.sh
啟動:chmod +x start.sh && ./start.sh
驗證:
curl http://localhost:8080/health
curl -X POST http://localhost:8080/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"model":"Qwen3.8-27B-IQ4_XS","messages":[{"role":"user","content":"用 Python 寫快速排序"}],"temperature":0.6,"max_tokens":1024}'
Prometheus (可選):抓取 localhost:9090/metrics
總結
RTX 5070 Ti 16GB + Qwen3.8-27B-IQ4_XS = 消費級單卡本地部署 27B 密集模型的性價比天花板。
能進:IQ4_XS 14.8 GB 模型 + 1.0 GB KV Cache = ~15.8 GB < 16 GB (全層上 GPU)
能跑:IQ4_XS 全層 38 tok/s 解碼、1,350 tok/s 預填;Q4_K_M offload 18-27 t/s
能用:Hermes Agent 整合無縫、工具調用正常、32K 上下文穩定
有未來:NVFP4 量化即將釋放 50%+ 紅利 (~13GB / 55-65 t/s)、Blackwell 架構壽命長
參考鏈接
- 模型:unsloth/Qwen3.8-27B-GGUF | Qwen 官方 | MTP 版
- llama.cpp:Repo | Release | NVFP4 PR #21095
- 實測基線:elsung/blackwell-16gb-llm-starter (RTX 5070 Ti 完整基準)
- 量化指南:willitrunai.com | Unsloth 文檔
- Hermes Agent:官網 | Desktop | 文檔
- 社區跑分:Reddit LocalLLaMA Qwen3.8 | arXiv: Private LLM on Blackwell
有補充或修正歡迎回帖討論。
標籤:#5070Ti #Qwen3.8-27B #llama.cpp #Blackwell #本地部署 #Hermes #實測 #避坑 #性價比 #GDDR7

️ 勉強
慢