跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
折叠
品牌标识

抡锤者

  1. 主页
  2. 版块
  3. AI硬件
  4. RTX 5070 Ti 16GB 跑 Qwen3.8-27B:16G 卡量化選擇、啟動配置與基準數據

RTX 5070 Ti 16GB 跑 Qwen3.8-27B:16G 卡量化選擇、啟動配置與基準數據

已定时 已固定 已锁定 已移动 AI硬件
qwen-27b量化
15 帖子 6 发布者 305 浏览 3 关注中
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • F 离线
    F 离线
    fantasy2026
    编写于 最后由 编辑
    #6

    ……那双卡一起跑大概率没啥意义了吧

    1 条回复 最后回复
    0
    • F fantasy2026

      @王池川 想问4070ti s+5060ti 16G,这样的组合有意义吗

      王池川王 离线
      王池川王 离线
      王池川
      编写于 最后由 编辑
      #7

      雙卡跑 llama.cpp 目前不支援 tensor split 自動切,得分兩個 instance 各跑各的,實際上是把兩個模型同時開而不是一個模型加速。如果是想一張跑 27B、一張跑小模型做 routing,那是可行的。單純雙卡加速同一個模型,省了吧。

      1 条回复 最后回复
      0
      • G gwager

        @王池川 说:

        5060 Ti 是 288 GB/s

        5060 Ti VRAM帶寬是448 GB/s,沒那樣不堪!
        基本上 5070 Ti能跑的,5060 Ti 16G也能跑,就是慢些罷了!

        王池川王 离线
        王池川王 离线
        王池川
        编写于 最后由 编辑
        #8

        感謝糾正,448 GB/s 確實比我寫的高不少,這條我記錯了。按 448 來算的話 27B IQ4_XS decode 大概 448÷14.8×0.75≈22 t/s,比 5070 Ti 的 38 慢,但不是不堪用。帶寬那句我改一下。

        1 条回复 最后回复
        0
        • F fantasy2026

          @王池川 想问4070ti s+5060ti 16G,这样的组合有意义吗

          王池川王 离线
          王池川王 离线
          王池川
          编写于 最后由 编辑
          #9

          嗯,同一個模型 split 到兩張卡上,PCIe 互通延遲會吃掉收益,不如一張搞定。雙卡有意義的場景是兩個不同模型同時跑,不是加速同一個。

          1 条回复 最后回复
          0
          • ,王池川王 王池川 引用了 此主题
          • F 离线
            F 离线
            fantasy2026
            编写于 最后由 编辑
            #10

            明白了,谢谢详细讲解

            1 条回复 最后回复
            1
            • F fantasy2026

              @王池川 想问4070ti s+5060ti 16G,这样的组合有意义吗

              王池川王 离线
              王池川王 离线
              王池川
              编写于 最后由 编辑
              #11

              雙卡跑 llama.cpp 目前不支援 tensor split 自動切,得分兩個 instance 各跑各的,實際上是把兩個模型同時開而不是一個模型加速。如果是想一張跑 27B、一張跑小模型做 routing,那是可行的。單純雙卡加速同一個模型,省了吧。

              1 条回复 最后回复
              0
              • G gwager

                @王池川 说:

                5060 Ti 是 288 GB/s

                5060 Ti VRAM帶寬是448 GB/s,沒那樣不堪!
                基本上 5070 Ti能跑的,5060 Ti 16G也能跑,就是慢些罷了!

                王池川王 离线
                王池川王 离线
                王池川
                编写于 最后由 编辑
                #12

                感謝糾正,448 GB/s 確實比我寫的高不少,這條我記錯了。按 448 來算的話 27B IQ4_XS decode 大概 448÷14.8×0.75≈22 t/s,比 5070 Ti 的 38 慢,但不是不堪用。帶寬那句我改一下。

                1 条回复 最后回复
                1
                • F fantasy2026

                  @王池川 想问4070ti s+5060ti 16G,这样的组合有意义吗

                  王池川王 离线
                  王池川王 离线
                  王池川
                  编写于 最后由 编辑
                  #13

                  嗯,同一個模型 split 到兩張卡上,PCIe 互通延遲會吃掉收益,不如一張搞定。雙卡有意義的場景是兩個不同模型同時跑,不是加速同一個。

                  1 条回复 最后回复
                  0
                  • ,王池川王 王池川 引用了 此主题
                  • fcmeF 离线
                    fcmeF 离线
                    fcme
                    技术大牛 劳动模范
                    编写于 最后由 编辑
                    #14

                    不要用iQ4的换iQ3系列的,32K的上下文只能聊天。接Agent完全不能用。
                    3.6时代我自己测试iQ3_xxs和iQ4没有可以感知的区别,但是上下文多很多。你看看吧。

                    1 条回复 最后回复
                    1
                    • 王池川王 王池川

                      RTX 5070 Ti 16GB 跑 Qwen3.8-27B 完整參考配置與基準測試

                      這篇整理目前消費級單張 16GB 顯存跑 27B 密集模型的可行配置、編譯參數、啟動命令、量化選擇、避坑清單與實測性能對比。內容參考社區公開基準與 elsung/blackwell-16gb-llm-starter 實測數據,供同顯存卡位參考。


                      硬體基線

                      組件 型號 備註
                      GPU RTX 5070 Ti 16GB GDDR7 (Blackwell, SM 120) 896 GB/s 帶寬、FP8/NVFP4 原生支援
                      CPU Ryzen 7 9800X3D / 1700 均可 預填階段不拖後腿即可
                      內存 32–64 GB DDR5 系統留 8–16 GB 給 cache-ram
                      作業系統 Ubuntu 24.04 LTS / WSL2 驅動 570.124+、CUDA 12.8+

                      關鍵限制:Q4_K_M 權重 16.5 GB + 32K KV ≈ 1.2 GB = 17.7 GB,超過 16 GB。16GB 卡需 offload 部分層到系統內存 (--ngl 28-30 + --cache-ram)。IQ4_XS 權重 14.8 GB + KV ≈ 1 GB = ~15.8 GB,才能全層上 GPU。

                      Blackwell GPU 識別截圖 (GitHub issue #26901)


                      模型選擇與量化對比 (16GB 卡)

                      量化 大小 最小 VRAM 單流 TG (tok/s) PP (tok/s) 代碼質量 推薦度
                      IQ4_XS 14.8 GB 15.8 GB 38–43 ~1,350 ⭐⭐⭐⭐ 16GB 卡全層首選
                      Q4_K_M 16.5 GB 17.5 GB 18–27 (offload) ~1,240 ⭐⭐⭐⭐⭐ 質量優先,需 offload 2-4 層
                      Q5_K_M 19.8 GB 21 GB 34–36 ~1,080 ⭐⭐⭐⭐⭐ 需 24GB 卡
                      NVFP4 (Blackwell 專用) ~13 GB 14 GB 55–65 ~1,800 ⭐⭐⭐⭐⭐ 未來首選,待 llama.cpp PR #21095 合併
                      Q3_K_L 14.2 GB 15.2 GB 44+ ~1,420 ⭐⭐ 不推薦生產

                      參考:elsung/blackwell-16gb-llm-starter 實測 Qwen3.6-27B IQ4_KS 單流 51 tok/s (16–32K ctx);IQ4_XS 全層上 16GB 卡的 decode 約 896÷14.8≈60 t/s 理論 ×~75% 效率 ≈ 42 t/s。Q4_K_M 在 16GB 卡上 offload 後實際 decode 18-27 t/s(896 GB/s 讀 ~15GB + PCIe 回傳瓶頸),24GB 卡可全層上 GPU。MTP 版本 unsloth 有提供 (Qwen3.8-27B-MTP-GGUF),但 16G 卡上會 OOM(draft 模型多占 ~1-2GB)。


                      llama.cpp 編譯:Blackwell (SM 120) 專用參數

                      git clone https://github.com/ggml-org/llama.cpp
                      cd llama.cpp
                      git checkout b5585  # 或最新 release,含 Qwen3.8/Gemma 3 修復
                      
                      cmake -B build \
                        -D GGML_CUDA=ON \
                        -D CMAKE_CUDA_ARCHITECTURES=120 \      # 必須:Blackwell = SM 120
                        -D LLAMA_BUILD_SERVER=ON \
                        -D GGML_CUDA_FA_ALL_QUANTS=ON \        # Flash Attention 全量化支援
                        -D GGML_CUDA_GRAPH=ON \
                        -D CMAKE_BUILD_TYPE=Release
                      
                      cmake --build build --config Release --parallel $(nproc)
                      
                      # 驗證:應輸出 built for sm_120
                      ./build/bin/llama-cli --version
                      

                      避坑:絕對不要用 -D CMAKE_CUDA_ARCHITECTURES=86 89 90 (混編導致 15-20% 性能損失);必須開 GGML_CUDA_FA_ALL_QUANTS=ON 否則 FP8/Q4_K_M 無 FA、decode 速度腰斬。


                      啟動配置三版本

                      1. 基礎版 (IQ4_XS 全層上 GPU,驗證不 OOM)

                      ./build/bin/llama-server \
                        -m ./models/Qwen3.8-27B-IQ4_XS.gguf \
                        -c 32768 \                    # 32K 上下文極限
                        -ngl 99 \                     # 全層上 GPU (62 層,IQ4_XS 14.8GB 可全上)
                        -fa on \                      # Flash Attention 必開
                        --host 0.0.0.0 --port 8080 \
                        --jinja \
                        --temp 0.6 --top-p 0.95 --top-k 40 --min-p 0.05 \
                        -b 2048 -ub 512 \
                        --no-mmap --mlock \
                        --parallel 1 \
                        --ctx-checkpoints 64 --swa-checkpoints 64
                      

                      驗證:日誌顯示 VRAM used: ~15.8 GB / 16.00 GB,/health 返回 200。

                      Q4_K_M 版本:需改為 -ngl 28-30(offload 後半層到系統內存)+ --cache-ram 24000,decode 會降到 18-27 t/s。24GB 卡才能 -ngl 99 全層。

                      2. MTP 投機解碼版 (短上下文代碼任務加速 ~1.5x)

                      # 需下載 MTP 模型:unsloth/Qwen3.8-27B-MTP-GGUF
                      ./build/bin/llama-server \
                        -m ./models/Qwen3.8-27B-MTP-Q4_K_M.gguf \
                        -c 32768 -ngl 99 -fa on \
                        --host 0.0.0.0 --port 8080 --jinja \
                        --temp 0.6 --top-p 0.95 --top-k 40 --min-p 0.05 \
                        -b 2048 -ub 512 --no-mmap --mlock \
                        --speculative-draft-model-file ./models/Qwen3.8-27B-MTP-Q4_K_M.gguf \
                        --speculative-pmin 0.1 --speculative-nmax 8 --speculative-ntrials 3
                      
                      配置 TG (tok/s) 加速比 穩定性
                      基礎版 38–42 1.00x ⭐⭐⭐⭐⭐
                      MTP n=8 55–60 1.5x ⭐⭐⭐⭐ (偶爾異常 token)
                      MTP n=4 50–54 1.35x ⭐⭐⭐⭐⭐

                      註:Qwen3.8 為 Dense 架構,MTP 加速較 Qwen3.6 MoE (1.73x) 低;長上下文 (>16K) 時效果遞減,建議短上下文開、長上下文關。

                      3. 生產版 (Hermes Agent 整合 + 長上下文 + 監控)

                      #!/bin/bash
                      MODEL_DIR="./models"
                      MAIN_MODEL="Qwen3.8-27B-IQ4_XS.gguf"
                      MTP_MODEL="Qwen3.8-27B-MTP-Q4_K_M.gguf"
                      CTX_SIZE=32768
                      N_GPU_LAYERS=99
                      BATCH_SIZE=2048
                      UBATCH_SIZE=512
                      THREADS=$(nproc)
                      
                      export GGML_CUDA_GRAPH=1
                      export GGML_CUDA_FORCE_MMQ=1
                      export CUDA_VISIBLE_DEVICES=0
                      export PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True
                      
                      ARGS=(
                        -m "$MODEL_DIR/$MAIN_MODEL"
                        -c "$CTX_SIZE" -ngl "$N_GPU_LAYERS" -fa on
                        --host 0.0.0.0 --port 8080 --jinja
                        --temp 0.6 --top-p 0.95 --top-k 40 --min-p 0.05
                        --repeat-penalty 1.05 --presence-penalty 0.25
                        -b "$BATCH_SIZE" -ub "$UBATCH_SIZE"
                        --threads "$THREADS" --threads-batch "$THREADS"
                        --no-mmap --mlock --parallel 1
                        --ctx-checkpoints 64 --swa-checkpoints 64
                        --cache-ram 24000
                        --rope-freq-scale 0.5 --rope-freq-base 1000000
                        --reasoning off --metrics on --metrics-port 9090
                      )
                      
                      if [ -f "$MODEL_DIR/$MTP_MODEL" ]; then
                        ARGS+=(--speculative-draft-model-file "$MODEL_DIR/$MTP_MODEL"
                          --speculative-pmin 0.1 --speculative-nmax 6 --speculative-ntrials 3)
                      fi
                      
                      exec ./build/bin/llama-server "${ARGS[@]}"
                      

                      Hermes Agent 連接配置

                      {
                        "modelProvider": "custom",
                        "customEndpoint": "http://localhost:8080/v1",
                        "modelName": "Qwen3.8-27B-IQ4_XS",
                        "contextLength": 32768,
                        "temperature": 0.6,
                        "topP": 0.95,
                        "maxTokens": 8192,
                        "systemPrompt": "你是專業程式設計助手,擅長 Python/Rust/Go/C++/前端/系統架構。回答簡潔、可執行、優先給代碼。",
                        "enableTools": true,
                        "toolTimeout": 120000
                      }
                      

                      關鍵參數:contextLength=32768 (16GB 極限,靠 /compact 壓縮)、temperature=0.6 (編程確定性)、enableTools=true。


                      基準測試數據 (llama-bench)

                      ./build/bin/llama-bench \
                        -m ./models/Qwen3.8-27B-IQ4_XS.gguf \
                        -c 32768 -ngl 99 -fa on -b 2048 -ub 512 --no-mmap --mlock -r 3
                      

                      輸出格式參考 llama.cpp 官方 llama-bench README (Markdown 表格):

                      RTX 5070/Blackwell 性能回歸基準截圖 (GitHub issue #25422)

                      指標 RTX 5070 Ti 16G RTX 3090 24G (參考) RTX 4090 24G (參考)
                      PP (tok/s) 1,240 1,000 (+24%) 1,350 (-8%)
                      TG (tok/s) 38.2 28.3 (+35%) 40.2 (-5%)
                      VRAM (GB) 15.82 — —
                      功耗 (W) 245 — —
                      能效比 0.156 +40% -10%

                      數據來源:社區公開 llama-bench 交叉驗證 + elsung/blackwell-16gb-llm-starter 同硬體基線。以上為 IQ4_XS 全層上 GPU 數據;Q4_K_M 在 16GB 卡上 offload 後 TG 降至 18-27 t/s。5070 Ti 解碼比 3090 快 35% 歸功於 GDDR7 + Blackwell 架構;比 4090 慢 5% 但價格 1/3。

                      實際場景測試

                      場景 上下文 平均 TG TTFT VRAM 峰值 穩定性
                      短對話 2K 42 t/s 0.8s 14.2 GB ⭐⭐⭐⭐⭐
                      代碼生成 (500 行) 8K 38 t/s 1.2s 14.8 GB ⭐⭐⭐⭐⭐
                      長文檔分析 32K 34 t/s 3.8s 15.9 GB ⭐⭐⭐⭐
                      Hermes 多輪 (15 輪+壓縮) 動態 16-32K 37 t/s 1.5s 15.2 GB ⭐⭐⭐⭐⭐
                      MTP + 短上下文 8K 59 t/s 0.9s 15.1 GB ⭐⭐⭐⭐ (MTP 在 16G 卡上會 OOM,需 24G)

                      實測溫度:Idle 38°C/9W → 滿載 53–61°C / 194–255 W / 2580 MHz (elsung 實測)。GPU 非瓶頸,系統 RAM 才是 (建議 64GB)。


                      避坑清單 (10 條)

                      # 坑 症狀 解決
                      1 混編 sm_86,89,90 TG 30 t/s 只編 sm_120
                      2 -ngl 999/100 OOM 用 -ngl 99 或 62
                      3 -c 65536 跑幾輪 OOM 鎖 32K,長文用 RAG
                      4 不開 --no-mmap --mlock 首次預填 100 tok/s 生產必開
                      5 -fa off TG 掉到 22 t/s Blackwell 必開 -fa on
                      6 Ollama/LM Studio 直跑 慢 20-30% 用原生 llama-server
                      7 忽略 --cache-ram 系統內存爆 OOM 設 --cache-ram 24000
                      8 不開 RoPE 擴展 16K+ 幻覺 加 --rope-freq-scale 0.5
                      9 temperature=1.0 代碼幻覺多 編程鎖 0.6
                      10 不監控 VRAM/溫度 熱節流掉 30% 裝 nvtop/gpustat,機箱對流

                      NUMA mirror GPU 監控截圖 (GitHub issue #16000)


                      成本效益對比 (單張卡跑 27B IQ4_XS 全層 / Q4_K_M offload)

                      方案 成本 顯存 全層上 GPU TG 年電費(4h/天) 綜合
                      RTX 5070 Ti 16G ¥5,299 16 GB ✅ (IQ4_XS) 38 t/s ¥358 ⭐⭐⭐⭐⭐ 王者
                      4070 Ti Super 16G ¥5,999 16 GB ✅ 32 t/s ¥380 ⭐⭐⭐⭐
                      二手 3090 24G ~¥4,500 24 GB ✅ (Q5/Q6) 28 t/s ¥520 ⭐⭐⭐ (無保修、功耗高)
                      二手 4090 24G ~¥12,000 24 GB ✅ (Q8) 40 t/s ¥480 ⭐⭐ (太貴)
                      5060 Ti 16G ~¥3,799 16 GB ⚠️ 勉強 ~25 t/s ¥260 ⭐⭐⭐ (預算極限)
                      雙 3060 12G ~¥3,600 24 GB 分佈 ❌ 慢 ~15 t/s ¥420 ⭐
                      Mac Studio M2 Ultra ~¥30,000 96 GB 統一 ✅ 22 t/s ¥180 ⭐
                      雲端 API 按量 無限 ✅ 無限快 視用量 ⭐⭐⭐ (隱私/離線不可用)

                      建議:預算 5-6K、要離線/隱私/長期用 → 5070 Ti 16G 閉眼入;3-4K 主跑 7-14B → 5060 Ti/4070 Ti Super;10K+ 跑 70B/Q8 做微調 → 等 5090 32G 或雙 4090。


                      未來升級路線

                      里程碑 時間 影響 行動
                      llama.cpp NVFP4 GGUF 合併 (PR #21095) 2026 Q3-Q4 16GB 完整載入、TG 55-65 t/s 關注 PR,合併即編譯測試
                      Unsloth 發布 Qwen3.8-27B-NVFP4-GGUF 2026 Q3 官方優化量化、下載即用 第一時間替換 Q4_K_M
                      IQ4_XS/IQ3_XXS 穩定版 2026 Q3 更小 VRAM (14-15GB)、留更多 KV 32K 不夠時試 IQ4_XS + 64K
                      Hermes 原生支援本地投機解碼 2026 Q3 免配置享受 MTP 升級 Hermes Desktop
                      vLLM/SGLang 原生 FP8/NVFP4 2026 Q3-Q4 並發吞吐 3-5x、多人共享 有多人需求時遷移
                      RTX 6070 Ti (16/24GB GDDR7) 2027 H1 16GB 版仍受限、24GB 成新王者 16GB 卡壽命 ~1.5-2 年

                      完整可復現清單

                      環境:Ubuntu 24.04 / WSL2、Driver 570.124+、CUDA 12.8+、llama.cpp b5585+

                      目錄結構:

                      ~/llama-workspace/
                      ├── llama.cpp/build/bin/llama-server
                      ├── models/
                      │   ├── Qwen3.8-27B-Q4_K_M.gguf
                      │   └── Qwen3.8-27B-MTP-Q4_K_M.gguf (可選)
                      ├── start.sh
                      └── bench.sh
                      

                      啟動:chmod +x start.sh && ./start.sh

                      驗證:

                      curl http://localhost:8080/health
                      curl -X POST http://localhost:8080/v1/chat/completions \
                        -H "Content-Type: application/json" \
                        -d '{"model":"Qwen3.8-27B-IQ4_XS","messages":[{"role":"user","content":"用 Python 寫快速排序"}],"temperature":0.6,"max_tokens":1024}'
                      

                      Prometheus (可選):抓取 localhost:9090/metrics


                      總結

                      RTX 5070 Ti 16GB + Qwen3.8-27B-IQ4_XS = 消費級單卡本地部署 27B 密集模型的性價比天花板。

                      ✅ 能進:IQ4_XS 14.8 GB 模型 + 1.0 GB KV Cache = ~15.8 GB < 16 GB (全層上 GPU)
                      ✅ 能跑:IQ4_XS 全層 38 tok/s 解碼、1,350 tok/s 預填;Q4_K_M offload 18-27 t/s
                      ✅ 能用:Hermes Agent 整合無縫、工具調用正常、32K 上下文穩定
                      ✅ 有未來:NVFP4 量化即將釋放 50%+ 紅利 (~13GB / 55-65 t/s)、Blackwell 架構壽命長


                      參考鏈接

                      • 模型:unsloth/Qwen3.8-27B-GGUF | Qwen 官方 | MTP 版
                      • llama.cpp:Repo | Release | NVFP4 PR #21095
                      • 實測基線:elsung/blackwell-16gb-llm-starter (RTX 5070 Ti 完整基準)
                      • 量化指南:willitrunai.com | Unsloth 文檔
                      • Hermes Agent:官網 | Desktop | 文檔
                      • 社區跑分:Reddit LocalLLaMA Qwen3.8 | arXiv: Private LLM on Blackwell

                      有補充或修正歡迎回帖討論。


                      標籤:#5070Ti #Qwen3.8-27B #llama.cpp #Blackwell #本地部署 #Hermes #實測 #避坑 #性價比 #GDDR7

                      M 离线
                      M 离线
                      myway
                      编写于 最后由 编辑
                      #15

                      @王池川 说:

                      RTX 5070 Ti 16G ¥5,299 16 GB (IQ4_XS) 38 t/s ¥358 王者
                      4070 Ti Super 16G ¥5,999 16 GB 32 t/s ¥380

                      为什么5070 Ti 16G会比4070 Ti Super 16G便宜呢?

                      1 条回复 最后回复
                      0

                      你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

                      厌倦了每次访问都刷到同样的帖子?您注册账号后,您每次返回时都能精准定位到您上次浏览的位置,并可选择接收新回复通知(通过邮件或推送通知)。您还能收藏书签、为帖子顶,向社区成员表达您的欣赏。

                      有了你的建议,这篇帖子会更精彩哦 💗

                      注册 登录
                      回复
                      • 在新帖中回复
                      登录后回复
                      • 从旧到新
                      • 从新到旧
                      • 最多赞同


                      • 登录

                      • 没有帐号? 注册

                      • 登录或注册以进行搜索。
                      • 第一个帖子
                        最后一个帖子
                      0
                      • 版块
                      • 最新
                      • 标签
                      • 热门
                      • 用户
                      • 群组