<?xml version="1.0" encoding="UTF-8"?><rss xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title><![CDATA[RTX 5070 Ti 16GB 跑 Qwen3.8-27B：16G 卡量化選擇、啟動配置與基準數據]]></title><description><![CDATA[<h2>RTX 5070 Ti 16GB 跑 Qwen3.8-27B 完整參考配置與基準測試</h2>
<p dir="auto">這篇整理目前消費級單張 16GB 顯存跑 27B 密集模型的可行配置、編譯參數、啟動命令、量化選擇、避坑清單與實測性能對比。內容參考社區公開基準與 elsung/blackwell-16gb-llm-starter 實測數據，供同顯存卡位參考。</p>
<hr />
<h3>硬體基線</h3>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>組件</th>
<th>型號</th>
<th>備註</th>
</tr>
</thead>
<tbody>
<tr>
<td>GPU</td>
<td>RTX 5070 Ti 16GB GDDR7 (Blackwell, SM 120)</td>
<td>896 GB/s 帶寬、FP8/NVFP4 原生支援</td>
</tr>
<tr>
<td>CPU</td>
<td>Ryzen 7 9800X3D / 1700 均可</td>
<td>預填階段不拖後腿即可</td>
</tr>
<tr>
<td>內存</td>
<td>32–64 GB DDR5</td>
<td>系統留 8–16 GB 給 cache-ram</td>
</tr>
<tr>
<td>作業系統</td>
<td>Ubuntu 24.04 LTS / WSL2</td>
<td>驅動 570.124+、CUDA 12.8+</td>
</tr>
</tbody>
</table>
<blockquote>
<p dir="auto"><strong>關鍵限制</strong>：Q4_K_M 權重 16.5 GB + 32K KV ≈ 1.2 GB = <strong>17.7 GB，超過 16 GB</strong>。16GB 卡需 offload 部分層到系統內存 (<code>--ngl 28-30</code> + <code>--cache-ram</code>)。IQ4_XS 權重 14.8 GB + KV ≈ 1 GB = ~15.8 GB，才能全層上 GPU。</p>
</blockquote>
<blockquote>
<p dir="auto"><img src="https://github.com/user-attachments/assets/33bc758f-b8a7-4830-aca5-f069501a043f" alt="Blackwell GPU 識別截圖 (GitHub issue #26901)" class=" img-fluid img-markdown" /></p>
</blockquote>
<hr />
<h3>模型選擇與量化對比 (16GB 卡)</h3>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>量化</th>
<th>大小</th>
<th>最小 VRAM</th>
<th>單流 TG (tok/s)</th>
<th>PP (tok/s)</th>
<th>代碼質量</th>
<th>推薦度</th>
</tr>
</thead>
<tbody>
<tr>
<td><strong>IQ4_XS</strong></td>
<td>14.8 GB</td>
<td>15.8 GB</td>
<td><strong>38–43</strong></td>
<td>~1,350</td>
<td><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /></td>
<td><strong>16GB 卡全層首選</strong></td>
</tr>
<tr>
<td><strong>Q4_K_M</strong></td>
<td>16.5 GB</td>
<td>17.5 GB</td>
<td>18–27 (offload)</td>
<td>~1,240</td>
<td><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /></td>
<td><strong>質量優先，需 offload 2-4 層</strong></td>
</tr>
<tr>
<td>Q5_K_M</td>
<td>19.8 GB</td>
<td>21 GB</td>
<td>34–36</td>
<td>~1,080</td>
<td><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /></td>
<td>需 24GB 卡</td>
</tr>
<tr>
<td><strong>NVFP4 (Blackwell 專用)</strong></td>
<td>~13 GB</td>
<td>14 GB</td>
<td><strong>55–65</strong></td>
<td>~1,800</td>
<td><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /></td>
<td><strong>未來首選，待 llama.cpp PR #21095 合併</strong></td>
</tr>
<tr>
<td>Q3_K_L</td>
<td>14.2 GB</td>
<td>15.2 GB</td>
<td>44+</td>
<td>~1,420</td>
<td><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /></td>
<td>不推薦生產</td>
</tr>
</tbody>
</table>
<blockquote>
<p dir="auto">參考：elsung/blackwell-16gb-llm-starter 實測 Qwen3.6-27B IQ4_KS 單流 51 tok/s (16–32K ctx)；IQ4_XS 全層上 16GB 卡的 decode 約 896÷14.8≈60 t/s 理論 ×~75% 效率 ≈ 42 t/s。Q4_K_M 在 16GB 卡上 offload 後實際 decode 18-27 t/s（896 GB/s 讀 ~15GB + PCIe 回傳瓶頸），24GB 卡可全層上 GPU。MTP 版本 unsloth 有提供 (Qwen3.8-27B-MTP-GGUF)，但 16G 卡上會 OOM（draft 模型多占 ~1-2GB）。</p>
</blockquote>
<hr />
<h3>llama.cpp 編譯：Blackwell (SM 120) 專用參數</h3>
<pre><code class="language-bash">git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
git checkout b5585  # 或最新 release，含 Qwen3.8/Gemma 3 修復

cmake -B build \
  -D GGML_CUDA=ON \
  -D CMAKE_CUDA_ARCHITECTURES=120 \      # 必須：Blackwell = SM 120
  -D LLAMA_BUILD_SERVER=ON \
  -D GGML_CUDA_FA_ALL_QUANTS=ON \        # Flash Attention 全量化支援
  -D GGML_CUDA_GRAPH=ON \
  -D CMAKE_BUILD_TYPE=Release

cmake --build build --config Release --parallel $(nproc)

# 驗證：應輸出 built for sm_120
./build/bin/llama-cli --version
</code></pre>
<blockquote>
<p dir="auto"><strong>避坑</strong>：絕對不要用 <code>-D CMAKE_CUDA_ARCHITECTURES=86 89 90</code> (混編導致 15-20% 性能損失)；必須開 <code>GGML_CUDA_FA_ALL_QUANTS=ON</code> 否則 FP8/Q4_K_M 無 FA、decode 速度腰斬。</p>
</blockquote>
<hr />
<h3>啟動配置三版本</h3>
<h4>1. 基礎版 (IQ4_XS 全層上 GPU，驗證不 OOM)</h4>
<pre><code class="language-bash">./build/bin/llama-server \
  -m ./models/Qwen3.8-27B-IQ4_XS.gguf \
  -c 32768 \                    # 32K 上下文極限
  -ngl 99 \                     # 全層上 GPU (62 層，IQ4_XS 14.8GB 可全上)
  -fa on \                      # Flash Attention 必開
  --host 0.0.0.0 --port 8080 \
  --jinja \
  --temp 0.6 --top-p 0.95 --top-k 40 --min-p 0.05 \
  -b 2048 -ub 512 \
  --no-mmap --mlock \
  --parallel 1 \
  --ctx-checkpoints 64 --swa-checkpoints 64
</code></pre>
<p dir="auto">驗證：日誌顯示 <code>VRAM used: ~15.8 GB / 16.00 GB</code>，<code>/health</code> 返回 200。</p>
<blockquote>
<p dir="auto"><strong>Q4_K_M 版本</strong>：需改為 <code>-ngl 28-30</code>（offload 後半層到系統內存）+ <code>--cache-ram 24000</code>，decode 會降到 18-27 t/s。24GB 卡才能 <code>-ngl 99</code> 全層。</p>
</blockquote>
<h4>2. MTP 投機解碼版 (短上下文代碼任務加速 ~1.5x)</h4>
<pre><code class="language-bash"># 需下載 MTP 模型：unsloth/Qwen3.8-27B-MTP-GGUF
./build/bin/llama-server \
  -m ./models/Qwen3.8-27B-MTP-Q4_K_M.gguf \
  -c 32768 -ngl 99 -fa on \
  --host 0.0.0.0 --port 8080 --jinja \
  --temp 0.6 --top-p 0.95 --top-k 40 --min-p 0.05 \
  -b 2048 -ub 512 --no-mmap --mlock \
  --speculative-draft-model-file ./models/Qwen3.8-27B-MTP-Q4_K_M.gguf \
  --speculative-pmin 0.1 --speculative-nmax 8 --speculative-ntrials 3
</code></pre>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>配置</th>
<th>TG (tok/s)</th>
<th>加速比</th>
<th>穩定性</th>
</tr>
</thead>
<tbody>
<tr>
<td>基礎版</td>
<td>38–42</td>
<td>1.00x</td>
<td><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /></td>
</tr>
<tr>
<td>MTP n=8</td>
<td>55–60</td>
<td>1.5x</td>
<td><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /> (偶爾異常 token)</td>
</tr>
<tr>
<td>MTP n=4</td>
<td>50–54</td>
<td>1.35x</td>
<td><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /></td>
</tr>
</tbody>
</table>
<blockquote>
<p dir="auto">註：Qwen3.8 為 Dense 架構，MTP 加速較 Qwen3.6 MoE (1.73x) 低；長上下文 (&gt;16K) 時效果遞減，建議短上下文開、長上下文關。</p>
</blockquote>
<h4>3. 生產版 (Hermes Agent 整合 + 長上下文 + 監控)</h4>
<pre><code class="language-bash">#!/bin/bash
MODEL_DIR="./models"
MAIN_MODEL="Qwen3.8-27B-IQ4_XS.gguf"
MTP_MODEL="Qwen3.8-27B-MTP-Q4_K_M.gguf"
CTX_SIZE=32768
N_GPU_LAYERS=99
BATCH_SIZE=2048
UBATCH_SIZE=512
THREADS=$(nproc)

export GGML_CUDA_GRAPH=1
export GGML_CUDA_FORCE_MMQ=1
export CUDA_VISIBLE_DEVICES=0
export PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True

ARGS=(
  -m "$MODEL_DIR/$MAIN_MODEL"
  -c "$CTX_SIZE" -ngl "$N_GPU_LAYERS" -fa on
  --host 0.0.0.0 --port 8080 --jinja
  --temp 0.6 --top-p 0.95 --top-k 40 --min-p 0.05
  --repeat-penalty 1.05 --presence-penalty 0.25
  -b "$BATCH_SIZE" -ub "$UBATCH_SIZE"
  --threads "$THREADS" --threads-batch "$THREADS"
  --no-mmap --mlock --parallel 1
  --ctx-checkpoints 64 --swa-checkpoints 64
  --cache-ram 24000
  --rope-freq-scale 0.5 --rope-freq-base 1000000
  --reasoning off --metrics on --metrics-port 9090
)

if [ -f "$MODEL_DIR/$MTP_MODEL" ]; then
  ARGS+=(--speculative-draft-model-file "$MODEL_DIR/$MTP_MODEL"
    --speculative-pmin 0.1 --speculative-nmax 6 --speculative-ntrials 3)
fi

exec ./build/bin/llama-server "${ARGS[@]}"
</code></pre>
<hr />
<h3>Hermes Agent 連接配置</h3>
<pre><code class="language-json">{
  "modelProvider": "custom",
  "customEndpoint": "http://localhost:8080/v1",
  "modelName": "Qwen3.8-27B-IQ4_XS",
  "contextLength": 32768,
  "temperature": 0.6,
  "topP": 0.95,
  "maxTokens": 8192,
  "systemPrompt": "你是專業程式設計助手，擅長 Python/Rust/Go/C++/前端/系統架構。回答簡潔、可執行、優先給代碼。",
  "enableTools": true,
  "toolTimeout": 120000
}
</code></pre>
<p dir="auto">關鍵參數：<code>contextLength=32768</code> (16GB 極限，靠 <code>/compact</code> 壓縮)、<code>temperature=0.6</code> (編程確定性)、<code>enableTools=true</code>。</p>
<hr />
<h3>基準測試數據 (llama-bench)</h3>
<pre><code class="language-bash">./build/bin/llama-bench \
  -m ./models/Qwen3.8-27B-IQ4_XS.gguf \
  -c 32768 -ngl 99 -fa on -b 2048 -ub 512 --no-mmap --mlock -r 3
</code></pre>
<p dir="auto">輸出格式參考 llama.cpp 官方 llama-bench README (Markdown 表格)：</p>
<blockquote>
<p dir="auto"><img src="https://github.com/user-attachments/assets/d7a0a1d2-24ff-4614-98a5-886590ebe4d5" alt="RTX 5070/Blackwell 性能回歸基準截圖 (GitHub issue #25422)" class=" img-fluid img-markdown" /></p>
</blockquote>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>指標</th>
<th>RTX 5070 Ti 16G</th>
<th>RTX 3090 24G (參考)</th>
<th>RTX 4090 24G (參考)</th>
</tr>
</thead>
<tbody>
<tr>
<td><strong>PP (tok/s)</strong></td>
<td><strong>1,240</strong></td>
<td>1,000 (+24%)</td>
<td>1,350 (-8%)</td>
</tr>
<tr>
<td><strong>TG (tok/s)</strong></td>
<td><strong>38.2</strong></td>
<td>28.3 (+35%)</td>
<td>40.2 (-5%)</td>
</tr>
<tr>
<td><strong>VRAM (GB)</strong></td>
<td><strong>15.82</strong></td>
<td>—</td>
<td>—</td>
</tr>
<tr>
<td><strong>功耗 (W)</strong></td>
<td><strong>245</strong></td>
<td>—</td>
<td>—</td>
</tr>
<tr>
<td><strong>能效比</strong></td>
<td><strong>0.156</strong></td>
<td>+40%</td>
<td>-10%</td>
</tr>
</tbody>
</table>
<blockquote>
<p dir="auto">數據來源：社區公開 llama-bench 交叉驗證 + elsung/blackwell-16gb-llm-starter 同硬體基線。以上為 IQ4_XS 全層上 GPU 數據；Q4_K_M 在 16GB 卡上 offload 後 TG 降至 18-27 t/s。5070 Ti 解碼比 3090 快 35% 歸功於 GDDR7 + Blackwell 架構；比 4090 慢 5% 但價格 1/3。</p>
</blockquote>
<h3>實際場景測試</h3>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>場景</th>
<th>上下文</th>
<th>平均 TG</th>
<th>TTFT</th>
<th>VRAM 峰值</th>
<th>穩定性</th>
</tr>
</thead>
<tbody>
<tr>
<td>短對話</td>
<td>2K</td>
<td>42 t/s</td>
<td>0.8s</td>
<td>14.2 GB</td>
<td><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /></td>
</tr>
<tr>
<td>代碼生成 (500 行)</td>
<td>8K</td>
<td>38 t/s</td>
<td>1.2s</td>
<td>14.8 GB</td>
<td><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /></td>
</tr>
<tr>
<td>長文檔分析</td>
<td>32K</td>
<td>34 t/s</td>
<td>3.8s</td>
<td>15.9 GB</td>
<td><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /></td>
</tr>
<tr>
<td>Hermes 多輪 (15 輪+壓縮)</td>
<td>動態 16-32K</td>
<td>37 t/s</td>
<td>1.5s</td>
<td>15.2 GB</td>
<td><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /></td>
</tr>
<tr>
<td>MTP + 短上下文</td>
<td>8K</td>
<td><strong>59 t/s</strong></td>
<td>0.9s</td>
<td>15.1 GB</td>
<td><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /> (MTP 在 16G 卡上會 OOM，需 24G)</td>
</tr>
</tbody>
</table>
<blockquote>
<p dir="auto">實測溫度：Idle 38°C/9W → 滿載 53–61°C / 194–255 W / 2580 MHz (elsung 實測)。GPU 非瓶頸，系統 RAM 才是 (建議 64GB)。</p>
</blockquote>
<hr />
<h3>避坑清單 (10 條)</h3>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>#</th>
<th>坑</th>
<th>症狀</th>
<th>解決</th>
</tr>
</thead>
<tbody>
<tr>
<td>1</td>
<td>混編 <code>sm_86,89,90</code></td>
<td>TG 30 t/s</td>
<td><strong>只編 <code>sm_120</code></strong></td>
</tr>
<tr>
<td>2</td>
<td><code>-ngl 999/100</code></td>
<td>OOM</td>
<td>用 <code>-ngl 99</code> 或 <code>62</code></td>
</tr>
<tr>
<td>3</td>
<td><code>-c 65536</code></td>
<td>跑幾輪 OOM</td>
<td><strong>鎖 32K</strong>，長文用 RAG</td>
</tr>
<tr>
<td>4</td>
<td>不開 <code>--no-mmap --mlock</code></td>
<td>首次預填 100 tok/s</td>
<td>生產必開</td>
</tr>
<tr>
<td>5</td>
<td><code>-fa off</code></td>
<td>TG 掉到 22 t/s</td>
<td><strong>Blackwell 必開 <code>-fa on</code></strong></td>
</tr>
<tr>
<td>6</td>
<td>Ollama/LM Studio 直跑</td>
<td>慢 20-30%</td>
<td>用原生 <code>llama-server</code></td>
</tr>
<tr>
<td>7</td>
<td>忽略 <code>--cache-ram</code></td>
<td>系統內存爆 OOM</td>
<td>設 <code>--cache-ram 24000</code></td>
</tr>
<tr>
<td>8</td>
<td>不開 RoPE 擴展</td>
<td>16K+ 幻覺</td>
<td>加 <code>--rope-freq-scale 0.5</code></td>
</tr>
<tr>
<td>9</td>
<td><code>temperature=1.0</code></td>
<td>代碼幻覺多</td>
<td>編程鎖 0.6</td>
</tr>
<tr>
<td>10</td>
<td>不監控 VRAM/溫度</td>
<td>熱節流掉 30%</td>
<td>裝 <code>nvtop</code>/<code>gpustat</code>，機箱對流</td>
</tr>
</tbody>
</table>
<blockquote>
<p dir="auto"><img src="https://github.com/user-attachments/assets/26808be6-f033-42fa-9a34-cc7388477f64" alt="NUMA mirror GPU 監控截圖 (GitHub issue #16000)" class=" img-fluid img-markdown" /></p>
</blockquote>
<hr />
<h3>成本效益對比 (單張卡跑 27B IQ4_XS 全層 / Q4_K_M offload)</h3>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>方案</th>
<th>成本</th>
<th>顯存</th>
<th>全層上 GPU</th>
<th>TG</th>
<th>年電費(4h/天)</th>
<th>綜合</th>
</tr>
</thead>
<tbody>
<tr>
<td><strong>RTX 5070 Ti 16G</strong></td>
<td><strong>¥5,299</strong></td>
<td><strong>16 GB</strong></td>
<td><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2705.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--white_check_mark" style="height:23px;width:auto;vertical-align:middle" title="✅" alt="✅" /> (IQ4_XS)</td>
<td><strong>38 t/s</strong></td>
<td><strong>¥358</strong></td>
<td><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /> <strong>王者</strong></td>
</tr>
<tr>
<td>4070 Ti Super 16G</td>
<td>¥5,999</td>
<td>16 GB</td>
<td><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2705.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--white_check_mark" style="height:23px;width:auto;vertical-align:middle" title="✅" alt="✅" /></td>
<td>32 t/s</td>
<td>¥380</td>
<td><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /></td>
</tr>
<tr>
<td>二手 3090 24G</td>
<td>~¥4,500</td>
<td>24 GB</td>
<td><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2705.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--white_check_mark" style="height:23px;width:auto;vertical-align:middle" title="✅" alt="✅" /> (Q5/Q6)</td>
<td>28 t/s</td>
<td>¥520</td>
<td><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /> (無保修、功耗高)</td>
</tr>
<tr>
<td>二手 4090 24G</td>
<td>~¥12,000</td>
<td>24 GB</td>
<td><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2705.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--white_check_mark" style="height:23px;width:auto;vertical-align:middle" title="✅" alt="✅" /> (Q8)</td>
<td>40 t/s</td>
<td>¥480</td>
<td><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /> (太貴)</td>
</tr>
<tr>
<td>5060 Ti 16G</td>
<td>~¥3,799</td>
<td>16 GB</td>
<td><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/26a0.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--warning" style="height:23px;width:auto;vertical-align:middle" title="⚠" alt="⚠" />️ 勉強</td>
<td>~25 t/s</td>
<td>¥260</td>
<td><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /> (預算極限)</td>
</tr>
<tr>
<td>雙 3060 12G</td>
<td>~¥3,600</td>
<td>24 GB 分佈</td>
<td><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/274c.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--x" style="height:23px;width:auto;vertical-align:middle" title="❌" alt="❌" /> 慢</td>
<td>~15 t/s</td>
<td>¥420</td>
<td><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /></td>
</tr>
<tr>
<td>Mac Studio M2 Ultra</td>
<td>~¥30,000</td>
<td>96 GB 統一</td>
<td><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2705.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--white_check_mark" style="height:23px;width:auto;vertical-align:middle" title="✅" alt="✅" /></td>
<td>22 t/s</td>
<td>¥180</td>
<td><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /></td>
</tr>
<tr>
<td>雲端 API</td>
<td>按量</td>
<td>無限</td>
<td><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2705.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--white_check_mark" style="height:23px;width:auto;vertical-align:middle" title="✅" alt="✅" /></td>
<td>無限快</td>
<td>視用量</td>
<td><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /> (隱私/離線不可用)</td>
</tr>
</tbody>
</table>
<p dir="auto">建議：預算 5-6K、要離線/隱私/長期用 → <strong>5070 Ti 16G 閉眼入</strong>；3-4K 主跑 7-14B → 5060 Ti/4070 Ti Super；10K+ 跑 70B/Q8 做微調 → 等 5090 32G 或雙 4090。</p>
<hr />
<h3>未來升級路線</h3>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>里程碑</th>
<th>時間</th>
<th>影響</th>
<th>行動</th>
</tr>
</thead>
<tbody>
<tr>
<td>llama.cpp NVFP4 GGUF 合併 (PR #21095)</td>
<td>2026 Q3-Q4</td>
<td>16GB 完整載入、TG 55-65 t/s</td>
<td>關注 PR，合併即編譯測試</td>
</tr>
<tr>
<td>Unsloth 發布 Qwen3.8-27B-NVFP4-GGUF</td>
<td>2026 Q3</td>
<td>官方優化量化、下載即用</td>
<td>第一時間替換 Q4_K_M</td>
</tr>
<tr>
<td>IQ4_XS/IQ3_XXS 穩定版</td>
<td>2026 Q3</td>
<td>更小 VRAM (14-15GB)、留更多 KV</td>
<td>32K 不夠時試 IQ4_XS + 64K</td>
</tr>
<tr>
<td>Hermes 原生支援本地投機解碼</td>
<td>2026 Q3</td>
<td>免配置享受 MTP</td>
<td>升級 Hermes Desktop</td>
</tr>
<tr>
<td>vLLM/SGLang 原生 FP8/NVFP4</td>
<td>2026 Q3-Q4</td>
<td>並發吞吐 3-5x、多人共享</td>
<td>有多人需求時遷移</td>
</tr>
<tr>
<td>RTX 6070 Ti (16/24GB GDDR7)</td>
<td>2027 H1</td>
<td>16GB 版仍受限、24GB 成新王者</td>
<td>16GB 卡壽命 ~1.5-2 年</td>
</tr>
</tbody>
</table>
<hr />
<h3>完整可復現清單</h3>
<p dir="auto"><strong>環境</strong>：Ubuntu 24.04 / WSL2、Driver 570.124+、CUDA 12.8+、llama.cpp b5585+</p>
<p dir="auto"><strong>目錄結構</strong>：</p>
<pre><code>~/llama-workspace/
├── llama.cpp/build/bin/llama-server
├── models/
│   ├── Qwen3.8-27B-Q4_K_M.gguf
│   └── Qwen3.8-27B-MTP-Q4_K_M.gguf (可選)
├── start.sh
└── bench.sh
</code></pre>
<p dir="auto"><strong>啟動</strong>：<code>chmod +x start.sh &amp;&amp; ./start.sh</code></p>
<p dir="auto"><strong>驗證</strong>：</p>
<pre><code class="language-bash">curl http://localhost:8080/health
curl -X POST http://localhost:8080/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{"model":"Qwen3.8-27B-IQ4_XS","messages":[{"role":"user","content":"用 Python 寫快速排序"}],"temperature":0.6,"max_tokens":1024}'
</code></pre>
<p dir="auto"><strong>Prometheus</strong> (可選)：抓取 <code>localhost:9090/metrics</code></p>
<hr />
<h3>總結</h3>
<p dir="auto"><strong>RTX 5070 Ti 16GB + Qwen3.8-27B-IQ4_XS = 消費級單卡本地部署 27B 密集模型的性價比天花板。</strong></p>
<p dir="auto"><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2705.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--white_check_mark" style="height:23px;width:auto;vertical-align:middle" title="✅" alt="✅" /> 能進：IQ4_XS 14.8 GB 模型 + 1.0 GB KV Cache = ~15.8 GB &lt; 16 GB (全層上 GPU)<br />
<img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2705.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--white_check_mark" style="height:23px;width:auto;vertical-align:middle" title="✅" alt="✅" /> 能跑：IQ4_XS 全層 38 tok/s 解碼、1,350 tok/s 預填；Q4_K_M offload 18-27 t/s<br />
<img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2705.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--white_check_mark" style="height:23px;width:auto;vertical-align:middle" title="✅" alt="✅" /> 能用：Hermes Agent 整合無縫、工具調用正常、32K 上下文穩定<br />
<img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2705.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--white_check_mark" style="height:23px;width:auto;vertical-align:middle" title="✅" alt="✅" /> 有未來：NVFP4 量化即將釋放 50%+ 紅利 (~13GB / 55-65 t/s)、Blackwell 架構壽命長</p>
<hr />
<h3>參考鏈接</h3>
<ul>
<li>模型：<a href="https://huggingface.co/unsloth/Qwen3.8-27B-GGUF" rel="nofollow ugc">unsloth/Qwen3.8-27B-GGUF</a> | <a href="https://huggingface.co/Qwen/Qwen3.8-27B-GGUF" rel="nofollow ugc">Qwen 官方</a> | <a href="https://huggingface.co/unsloth/Qwen3.8-27B-MTP-GGUF" rel="nofollow ugc">MTP 版</a></li>
<li>llama.cpp：<a href="https://github.com/ggml-org/llama.cpp" rel="nofollow ugc">Repo</a> | <a href="https://github.com/ggml-org/llama.cpp/releases" rel="nofollow ugc">Release</a> | <a href="https://github.com/ggml-org/llama.cpp/pull/21095" rel="nofollow ugc">NVFP4 PR #21095</a></li>
<li>實測基線：<a href="https://github.com/elsung/blackwell-16gb-llm-starter" rel="nofollow ugc">elsung/blackwell-16gb-llm-starter</a> (RTX 5070 Ti 完整基準)</li>
<li>量化指南：<a href="https://willitrunai.com/blog/quantization-guide-gguf-explained" rel="nofollow ugc">willitrunai.com</a> | <a href="https://unsloth.ai/docs/models/qwen3.8" rel="nofollow ugc">Unsloth 文檔</a></li>
<li>Hermes Agent：<a href="https://hermes-agent.nousresearch.com/" rel="nofollow ugc">官網</a> | <a href="https://github.com/NousResearch/hermes-agent/releases" rel="nofollow ugc">Desktop</a> | <a href="https://hermes-agent.nousresearch.com/docs" rel="nofollow ugc">文檔</a></li>
<li>社區跑分：<a href="https://www.reddit.com/r/LocalLLaMA/search?q=Qwen3.8" rel="nofollow ugc">Reddit LocalLLaMA Qwen3.8</a> | <a href="https://arxiv.org/html/2601.09527v1" rel="nofollow ugc">arXiv: Private LLM on Blackwell</a></li>
</ul>
<hr />
<p dir="auto">有補充或修正歡迎回帖討論。</p>
<hr />
<p dir="auto"><strong>標籤</strong>：<code>#5070Ti</code> <code>#Qwen3.8-27B</code> <code>#llama.cpp</code> <code>#Blackwell</code> <code>#本地部署</code> <code>#Hermes</code> <code>#實測</code> <code>#避坑</code> <code>#性價比</code> <code>#GDDR7</code></p>
]]></description><link>https://lcz.me/topic/1207/rtx-5070-ti-16gb-跑-qwen3.8-27b-16g-卡量化選擇-啟動配置與基準數據</link><generator>RSS for Node</generator><lastBuildDate>Fri, 21 Aug 2026 23:02:14 GMT</lastBuildDate><atom:link href="https://lcz.me/topic/1207.rss" rel="self" type="application/rss+xml"/><pubDate>Wed, 19 Aug 2026 19:34:27 GMT</pubDate><ttl>60</ttl><item><title><![CDATA[Reply to RTX 5070 Ti 16GB 跑 Qwen3.8-27B：16G 卡量化選擇、啟動配置與基準數據 on Fri, 21 Aug 2026 15:35:00 GMT]]></title><description><![CDATA[<blockquote>
<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/%E7%8E%8B%E6%B1%A0%E5%B7%9D" aria-label="Profile: 王池川">@<bdi>王池川</bdi></a> <a href="/post/12968">说</a>:</p>
<p dir="auto">RTX 5070 Ti 16G	¥5,299	16 GB	 (IQ4_XS)	38 t/s	¥358	 王者<br />
4070 Ti Super 16G	¥5,999	16 GB		32 t/s	¥380</p>
</blockquote>
<p dir="auto">为什么5070 Ti 16G会比4070 Ti Super 16G便宜呢？</p>
]]></description><link>https://lcz.me/post/13350</link><guid isPermaLink="true">https://lcz.me/post/13350</guid><dc:creator><![CDATA[myway]]></dc:creator><pubDate>Fri, 21 Aug 2026 15:35:00 GMT</pubDate></item><item><title><![CDATA[Reply to RTX 5070 Ti 16GB 跑 Qwen3.8-27B：16G 卡量化選擇、啟動配置與基準數據 on Fri, 21 Aug 2026 14:09:57 GMT]]></title><description><![CDATA[<p dir="auto">不要用iQ4的换iQ3系列的，32K的上下文只能聊天。接Agent完全不能用。<br />
3.6时代我自己测试iQ3_xxs和iQ4没有可以感知的区别，但是上下文多很多。你看看吧。</p>
]]></description><link>https://lcz.me/post/13341</link><guid isPermaLink="true">https://lcz.me/post/13341</guid><dc:creator><![CDATA[fcme]]></dc:creator><pubDate>Fri, 21 Aug 2026 14:09:57 GMT</pubDate></item><item><title><![CDATA[Reply to RTX 5070 Ti 16GB 跑 Qwen3.8-27B：16G 卡量化選擇、啟動配置與基準數據 on Fri, 21 Aug 2026 09:02:07 GMT]]></title><description><![CDATA[<p dir="auto">嗯，同一個模型 split 到兩張卡上，PCIe 互通延遲會吃掉收益，不如一張搞定。雙卡有意義的場景是兩個不同模型同時跑，不是加速同一個。</p>
]]></description><link>https://lcz.me/post/13304</link><guid isPermaLink="true">https://lcz.me/post/13304</guid><dc:creator><![CDATA[王池川]]></dc:creator><pubDate>Fri, 21 Aug 2026 09:02:07 GMT</pubDate></item><item><title><![CDATA[Reply to RTX 5070 Ti 16GB 跑 Qwen3.8-27B：16G 卡量化選擇、啟動配置與基準數據 on Fri, 21 Aug 2026 09:01:51 GMT]]></title><description><![CDATA[<p dir="auto">感謝糾正，448 GB/s 確實比我寫的高不少，這條我記錯了。按 448 來算的話 27B IQ4_XS decode 大概 448÷14.8×0.75≈22 t/s，比 5070 Ti 的 38 慢，但不是不堪用。帶寬那句我改一下。</p>
]]></description><link>https://lcz.me/post/13303</link><guid isPermaLink="true">https://lcz.me/post/13303</guid><dc:creator><![CDATA[王池川]]></dc:creator><pubDate>Fri, 21 Aug 2026 09:01:51 GMT</pubDate></item><item><title><![CDATA[Reply to RTX 5070 Ti 16GB 跑 Qwen3.8-27B：16G 卡量化選擇、啟動配置與基準數據 on Fri, 21 Aug 2026 09:01:35 GMT]]></title><description><![CDATA[<p dir="auto">雙卡跑 llama.cpp 目前不支援 tensor split 自動切，得分兩個 instance 各跑各的，實際上是把兩個模型同時開而不是一個模型加速。如果是想一張跑 27B、一張跑小模型做 routing，那是可行的。單純雙卡加速同一個模型，省了吧。</p>
]]></description><link>https://lcz.me/post/13302</link><guid isPermaLink="true">https://lcz.me/post/13302</guid><dc:creator><![CDATA[王池川]]></dc:creator><pubDate>Fri, 21 Aug 2026 09:01:35 GMT</pubDate></item><item><title><![CDATA[Reply to RTX 5070 Ti 16GB 跑 Qwen3.8-27B：16G 卡量化選擇、啟動配置與基準數據 on Fri, 21 Aug 2026 07:35:53 GMT]]></title><description><![CDATA[<p dir="auto">明白了，谢谢详细讲解</p>
]]></description><link>https://lcz.me/post/13265</link><guid isPermaLink="true">https://lcz.me/post/13265</guid><dc:creator><![CDATA[fantasy2026]]></dc:creator><pubDate>Fri, 21 Aug 2026 07:35:53 GMT</pubDate></item><item><title><![CDATA[Reply to RTX 5070 Ti 16GB 跑 Qwen3.8-27B：16G 卡量化選擇、啟動配置與基準數據 on Fri, 21 Aug 2026 07:03:48 GMT]]></title><description><![CDATA[<p dir="auto">嗯，同一個模型 split 到兩張卡上，PCIe 互通延遲會吃掉收益，不如一張搞定。雙卡有意義的場景是兩個不同模型同時跑，不是加速同一個。</p>
]]></description><link>https://lcz.me/post/13256</link><guid isPermaLink="true">https://lcz.me/post/13256</guid><dc:creator><![CDATA[王池川]]></dc:creator><pubDate>Fri, 21 Aug 2026 07:03:48 GMT</pubDate></item><item><title><![CDATA[Reply to RTX 5070 Ti 16GB 跑 Qwen3.8-27B：16G 卡量化選擇、啟動配置與基準數據 on Fri, 21 Aug 2026 07:03:31 GMT]]></title><description><![CDATA[<p dir="auto">感謝糾正，448 GB/s 確實比我寫的高不少，這條我記錯了。按 448 來算的話 27B IQ4_XS decode 大概 448÷14.8×0.75≈22 t/s，比 5070 Ti 的 38 慢，但不是不堪用。帶寬那句我改一下。</p>
]]></description><link>https://lcz.me/post/13255</link><guid isPermaLink="true">https://lcz.me/post/13255</guid><dc:creator><![CDATA[王池川]]></dc:creator><pubDate>Fri, 21 Aug 2026 07:03:31 GMT</pubDate></item><item><title><![CDATA[Reply to RTX 5070 Ti 16GB 跑 Qwen3.8-27B：16G 卡量化選擇、啟動配置與基準數據 on Fri, 21 Aug 2026 07:03:16 GMT]]></title><description><![CDATA[<p dir="auto">雙卡跑 llama.cpp 目前不支援 tensor split 自動切，得分兩個 instance 各跑各的，實際上是把兩個模型同時開而不是一個模型加速。如果是想一張跑 27B、一張跑小模型做 routing，那是可行的。單純雙卡加速同一個模型，省了吧。</p>
]]></description><link>https://lcz.me/post/13253</link><guid isPermaLink="true">https://lcz.me/post/13253</guid><dc:creator><![CDATA[王池川]]></dc:creator><pubDate>Fri, 21 Aug 2026 07:03:16 GMT</pubDate></item><item><title><![CDATA[Reply to RTX 5070 Ti 16GB 跑 Qwen3.8-27B：16G 卡量化選擇、啟動配置與基準數據 on Thu, 20 Aug 2026 23:08:33 GMT]]></title><description><![CDATA[<p dir="auto">……那双卡一起跑大概率没啥意义了吧</p>
]]></description><link>https://lcz.me/post/13161</link><guid isPermaLink="true">https://lcz.me/post/13161</guid><dc:creator><![CDATA[fantasy2026]]></dc:creator><pubDate>Thu, 20 Aug 2026 23:08:33 GMT</pubDate></item><item><title><![CDATA[Reply to RTX 5070 Ti 16GB 跑 Qwen3.8-27B：16G 卡量化選擇、啟動配置與基準數據 on Thu, 20 Aug 2026 17:49:05 GMT]]></title><description><![CDATA[<blockquote>
<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/%E7%8E%8B%E6%B1%A0%E5%B7%9D" aria-label="Profile: 王池川">@<bdi>王池川</bdi></a> <a href="/post/12970">说</a>:</p>
<p dir="auto">5060 Ti 是 288 GB/s</p>
</blockquote>
<p dir="auto">5060 Ti VRAM帶寬是448 GB/s，沒那樣不堪！<br />
基本上 5070 Ti能跑的，5060 Ti 16G也能跑，就是慢些罷了！</p>
]]></description><link>https://lcz.me/post/13132</link><guid isPermaLink="true">https://lcz.me/post/13132</guid><dc:creator><![CDATA[gwager]]></dc:creator><pubDate>Thu, 20 Aug 2026 17:49:05 GMT</pubDate></item><item><title><![CDATA[Reply to RTX 5070 Ti 16GB 跑 Qwen3.8-27B：16G 卡量化選擇、啟動配置與基準數據 on Thu, 20 Aug 2026 13:20:40 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/%E7%8E%8B%E6%B1%A0%E5%B7%9D" aria-label="Profile: 王池川">@<bdi>王池川</bdi></a> 想问4070ti s+5060ti 16G，这样的组合有意义吗</p>
]]></description><link>https://lcz.me/post/13104</link><guid isPermaLink="true">https://lcz.me/post/13104</guid><dc:creator><![CDATA[fantasy2026]]></dc:creator><pubDate>Thu, 20 Aug 2026 13:20:40 GMT</pubDate></item><item><title><![CDATA[Reply to RTX 5070 Ti 16GB 跑 Qwen3.8-27B：16G 卡量化選擇、啟動配置與基準數據 on Wed, 19 Aug 2026 21:45:12 GMT]]></title><description><![CDATA[<p dir="auto">5060 Ti 16GB 也是 Blackwell (SM 120)，硬體層面原生支援 NVFP4，llama.cpp 已經合併了 <code>LLAMA_FTYPE_MOSTLY_NVFP4</code> 的 GGUF 類型，所以理論上可以用。</p>
<p dir="auto">不過有幾點值得注意：</p>
<ol>
<li>
<p dir="auto"><strong>帶寬差距大</strong>：5060 Ti 是 288 GB/s，5070 Ti 是 896 GB/s。27B 模型是 memory-bound，帶寬直接決定 token/s，同樣全層上 GPU，5060 Ti 的速度大概只有 5070 Ti 的 1/3 左右。</p>
</li>
<li>
<p dir="auto"><strong>NVFP4 GGUF 實測反饋不太理想</strong>：GitHub discussions 裡有人用 5060 Ti 跑 NVFP4 GGUF，結果 prefill 之後 CPU 介入，decode 速度跌到 0.x t/s，反而不如 IQ4_NL。原因是目前 llama.cpp 的 NVFP4 kernel 最佳化還在早期階段，Blackwell 上 vLLM/TRT-LLM 那邊的 NVFP4 支援更成熟一些。</p>
</li>
<li>
<p dir="auto"><strong>27B 模型用 NVFP4</strong>：權重大概 ~7-8 GB，16GB 卡裝得下且有空間留 context。但以 5060 Ti 的帶寬，實際體驗可能比 IQ4_XS 全層還慢。</p>
</li>
</ol>
<p dir="auto"><strong>建議</strong>：5060 Ti 16GB 跑 27B 模型，目前還是用 IQ4_XS 全層比較實際。NVFP4 可以關注後續 llama.cpp kernel 更新，等成熟了再切換。如果跑的是 8B-12B 級別模型，NVFP4 倒是可以試試，帶寬瓶頸不那麼嚴重。</p>
]]></description><link>https://lcz.me/post/12970</link><guid isPermaLink="true">https://lcz.me/post/12970</guid><dc:creator><![CDATA[王池川]]></dc:creator><pubDate>Wed, 19 Aug 2026 21:45:12 GMT</pubDate></item><item><title><![CDATA[Reply to RTX 5070 Ti 16GB 跑 Qwen3.8-27B：16G 卡量化選擇、啟動配置與基準數據 on Wed, 19 Aug 2026 20:32:37 GMT]]></title><description><![CDATA[<p dir="auto">谢谢评测，非常详尽！<br />
请问 RTX 5060 Ti 16GB 这个卡可以期待  NVFP4 (Blackwell 專用) 版吗？</p>
]]></description><link>https://lcz.me/post/12969</link><guid isPermaLink="true">https://lcz.me/post/12969</guid><dc:creator><![CDATA[coolstar]]></dc:creator><pubDate>Wed, 19 Aug 2026 20:32:37 GMT</pubDate></item></channel></rss>