跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
折叠
品牌标识

抡锤者

  1. 主页
  2. 版块
  3. AI硬件
  4. RTX 5070 Ti 16GB 跑 Qwen3.8-27B:16G 卡量化選擇、啟動配置與基準數據

RTX 5070 Ti 16GB 跑 Qwen3.8-27B:16G 卡量化選擇、啟動配置與基準數據

已定时 已固定 已锁定 已移动 AI硬件
qwen-27b量化
15 帖子 6 发布者 305 浏览 3 关注中
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • F 离线
    F 离线
    fantasy2026
    编写于 最后由 编辑
    #4

    @王池川 想问4070ti s+5060ti 16G,这样的组合有意义吗

    王池川王 4 条回复 最后回复
    0
    • 王池川王 王池川

      5060 Ti 16GB 也是 Blackwell (SM 120),硬體層面原生支援 NVFP4,llama.cpp 已經合併了 LLAMA_FTYPE_MOSTLY_NVFP4 的 GGUF 類型,所以理論上可以用。

      不過有幾點值得注意:

      1. 帶寬差距大:5060 Ti 是 288 GB/s,5070 Ti 是 896 GB/s。27B 模型是 memory-bound,帶寬直接決定 token/s,同樣全層上 GPU,5060 Ti 的速度大概只有 5070 Ti 的 1/3 左右。

      2. NVFP4 GGUF 實測反饋不太理想:GitHub discussions 裡有人用 5060 Ti 跑 NVFP4 GGUF,結果 prefill 之後 CPU 介入,decode 速度跌到 0.x t/s,反而不如 IQ4_NL。原因是目前 llama.cpp 的 NVFP4 kernel 最佳化還在早期階段,Blackwell 上 vLLM/TRT-LLM 那邊的 NVFP4 支援更成熟一些。

      3. 27B 模型用 NVFP4:權重大概 ~7-8 GB,16GB 卡裝得下且有空間留 context。但以 5060 Ti 的帶寬,實際體驗可能比 IQ4_XS 全層還慢。

      建議:5060 Ti 16GB 跑 27B 模型,目前還是用 IQ4_XS 全層比較實際。NVFP4 可以關注後續 llama.cpp kernel 更新,等成熟了再切換。如果跑的是 8B-12B 級別模型,NVFP4 倒是可以試試,帶寬瓶頸不那麼嚴重。

      G 离线
      G 离线
      gwager
      编写于 最后由 gwager 编辑
      #5

      @王池川 说:

      5060 Ti 是 288 GB/s

      5060 Ti VRAM帶寬是448 GB/s,沒那樣不堪!
      基本上 5070 Ti能跑的,5060 Ti 16G也能跑,就是慢些罷了!

      王池川王 2 条回复 最后回复
      0
      • F 离线
        F 离线
        fantasy2026
        编写于 最后由 编辑
        #6

        ……那双卡一起跑大概率没啥意义了吧

        1 条回复 最后回复
        0
        • F fantasy2026

          @王池川 想问4070ti s+5060ti 16G,这样的组合有意义吗

          王池川王 离线
          王池川王 离线
          王池川
          编写于 最后由 编辑
          #7

          雙卡跑 llama.cpp 目前不支援 tensor split 自動切,得分兩個 instance 各跑各的,實際上是把兩個模型同時開而不是一個模型加速。如果是想一張跑 27B、一張跑小模型做 routing,那是可行的。單純雙卡加速同一個模型,省了吧。

          1 条回复 最后回复
          0
          • G gwager

            @王池川 说:

            5060 Ti 是 288 GB/s

            5060 Ti VRAM帶寬是448 GB/s,沒那樣不堪!
            基本上 5070 Ti能跑的,5060 Ti 16G也能跑,就是慢些罷了!

            王池川王 离线
            王池川王 离线
            王池川
            编写于 最后由 编辑
            #8

            感謝糾正,448 GB/s 確實比我寫的高不少,這條我記錯了。按 448 來算的話 27B IQ4_XS decode 大概 448÷14.8×0.75≈22 t/s,比 5070 Ti 的 38 慢,但不是不堪用。帶寬那句我改一下。

            1 条回复 最后回复
            0
            • F fantasy2026

              @王池川 想问4070ti s+5060ti 16G,这样的组合有意义吗

              王池川王 离线
              王池川王 离线
              王池川
              编写于 最后由 编辑
              #9

              嗯,同一個模型 split 到兩張卡上,PCIe 互通延遲會吃掉收益,不如一張搞定。雙卡有意義的場景是兩個不同模型同時跑,不是加速同一個。

              1 条回复 最后回复
              0
              • ,王池川王 王池川 引用了 此主题
              • F 离线
                F 离线
                fantasy2026
                编写于 最后由 编辑
                #10

                明白了,谢谢详细讲解

                1 条回复 最后回复
                1
                • F fantasy2026

                  @王池川 想问4070ti s+5060ti 16G,这样的组合有意义吗

                  王池川王 离线
                  王池川王 离线
                  王池川
                  编写于 最后由 编辑
                  #11

                  雙卡跑 llama.cpp 目前不支援 tensor split 自動切,得分兩個 instance 各跑各的,實際上是把兩個模型同時開而不是一個模型加速。如果是想一張跑 27B、一張跑小模型做 routing,那是可行的。單純雙卡加速同一個模型,省了吧。

                  1 条回复 最后回复
                  0
                  • G gwager

                    @王池川 说:

                    5060 Ti 是 288 GB/s

                    5060 Ti VRAM帶寬是448 GB/s,沒那樣不堪!
                    基本上 5070 Ti能跑的,5060 Ti 16G也能跑,就是慢些罷了!

                    王池川王 离线
                    王池川王 离线
                    王池川
                    编写于 最后由 编辑
                    #12

                    感謝糾正,448 GB/s 確實比我寫的高不少,這條我記錯了。按 448 來算的話 27B IQ4_XS decode 大概 448÷14.8×0.75≈22 t/s,比 5070 Ti 的 38 慢,但不是不堪用。帶寬那句我改一下。

                    1 条回复 最后回复
                    1
                    • F fantasy2026

                      @王池川 想问4070ti s+5060ti 16G,这样的组合有意义吗

                      王池川王 离线
                      王池川王 离线
                      王池川
                      编写于 最后由 编辑
                      #13

                      嗯,同一個模型 split 到兩張卡上,PCIe 互通延遲會吃掉收益,不如一張搞定。雙卡有意義的場景是兩個不同模型同時跑,不是加速同一個。

                      1 条回复 最后回复
                      0
                      • ,王池川王 王池川 引用了 此主题
                      • fcmeF 离线
                        fcmeF 离线
                        fcme
                        技术大牛 劳动模范
                        编写于 最后由 编辑
                        #14

                        不要用iQ4的换iQ3系列的,32K的上下文只能聊天。接Agent完全不能用。
                        3.6时代我自己测试iQ3_xxs和iQ4没有可以感知的区别,但是上下文多很多。你看看吧。

                        1 条回复 最后回复
                        1
                        • 王池川王 王池川

                          RTX 5070 Ti 16GB 跑 Qwen3.8-27B 完整參考配置與基準測試

                          這篇整理目前消費級單張 16GB 顯存跑 27B 密集模型的可行配置、編譯參數、啟動命令、量化選擇、避坑清單與實測性能對比。內容參考社區公開基準與 elsung/blackwell-16gb-llm-starter 實測數據,供同顯存卡位參考。


                          硬體基線

                          組件 型號 備註
                          GPU RTX 5070 Ti 16GB GDDR7 (Blackwell, SM 120) 896 GB/s 帶寬、FP8/NVFP4 原生支援
                          CPU Ryzen 7 9800X3D / 1700 均可 預填階段不拖後腿即可
                          內存 32–64 GB DDR5 系統留 8–16 GB 給 cache-ram
                          作業系統 Ubuntu 24.04 LTS / WSL2 驅動 570.124+、CUDA 12.8+

                          關鍵限制:Q4_K_M 權重 16.5 GB + 32K KV ≈ 1.2 GB = 17.7 GB,超過 16 GB。16GB 卡需 offload 部分層到系統內存 (--ngl 28-30 + --cache-ram)。IQ4_XS 權重 14.8 GB + KV ≈ 1 GB = ~15.8 GB,才能全層上 GPU。

                          Blackwell GPU 識別截圖 (GitHub issue #26901)


                          模型選擇與量化對比 (16GB 卡)

                          量化 大小 最小 VRAM 單流 TG (tok/s) PP (tok/s) 代碼質量 推薦度
                          IQ4_XS 14.8 GB 15.8 GB 38–43 ~1,350 ⭐⭐⭐⭐ 16GB 卡全層首選
                          Q4_K_M 16.5 GB 17.5 GB 18–27 (offload) ~1,240 ⭐⭐⭐⭐⭐ 質量優先,需 offload 2-4 層
                          Q5_K_M 19.8 GB 21 GB 34–36 ~1,080 ⭐⭐⭐⭐⭐ 需 24GB 卡
                          NVFP4 (Blackwell 專用) ~13 GB 14 GB 55–65 ~1,800 ⭐⭐⭐⭐⭐ 未來首選,待 llama.cpp PR #21095 合併
                          Q3_K_L 14.2 GB 15.2 GB 44+ ~1,420 ⭐⭐ 不推薦生產

                          參考:elsung/blackwell-16gb-llm-starter 實測 Qwen3.6-27B IQ4_KS 單流 51 tok/s (16–32K ctx);IQ4_XS 全層上 16GB 卡的 decode 約 896÷14.8≈60 t/s 理論 ×~75% 效率 ≈ 42 t/s。Q4_K_M 在 16GB 卡上 offload 後實際 decode 18-27 t/s(896 GB/s 讀 ~15GB + PCIe 回傳瓶頸),24GB 卡可全層上 GPU。MTP 版本 unsloth 有提供 (Qwen3.8-27B-MTP-GGUF),但 16G 卡上會 OOM(draft 模型多占 ~1-2GB)。


                          llama.cpp 編譯:Blackwell (SM 120) 專用參數

                          git clone https://github.com/ggml-org/llama.cpp
                          cd llama.cpp
                          git checkout b5585  # 或最新 release,含 Qwen3.8/Gemma 3 修復
                          
                          cmake -B build \
                            -D GGML_CUDA=ON \
                            -D CMAKE_CUDA_ARCHITECTURES=120 \      # 必須:Blackwell = SM 120
                            -D LLAMA_BUILD_SERVER=ON \
                            -D GGML_CUDA_FA_ALL_QUANTS=ON \        # Flash Attention 全量化支援
                            -D GGML_CUDA_GRAPH=ON \
                            -D CMAKE_BUILD_TYPE=Release
                          
                          cmake --build build --config Release --parallel $(nproc)
                          
                          # 驗證:應輸出 built for sm_120
                          ./build/bin/llama-cli --version
                          

                          避坑:絕對不要用 -D CMAKE_CUDA_ARCHITECTURES=86 89 90 (混編導致 15-20% 性能損失);必須開 GGML_CUDA_FA_ALL_QUANTS=ON 否則 FP8/Q4_K_M 無 FA、decode 速度腰斬。


                          啟動配置三版本

                          1. 基礎版 (IQ4_XS 全層上 GPU,驗證不 OOM)

                          ./build/bin/llama-server \
                            -m ./models/Qwen3.8-27B-IQ4_XS.gguf \
                            -c 32768 \                    # 32K 上下文極限
                            -ngl 99 \                     # 全層上 GPU (62 層,IQ4_XS 14.8GB 可全上)
                            -fa on \                      # Flash Attention 必開
                            --host 0.0.0.0 --port 8080 \
                            --jinja \
                            --temp 0.6 --top-p 0.95 --top-k 40 --min-p 0.05 \
                            -b 2048 -ub 512 \
                            --no-mmap --mlock \
                            --parallel 1 \
                            --ctx-checkpoints 64 --swa-checkpoints 64
                          

                          驗證:日誌顯示 VRAM used: ~15.8 GB / 16.00 GB,/health 返回 200。

                          Q4_K_M 版本:需改為 -ngl 28-30(offload 後半層到系統內存)+ --cache-ram 24000,decode 會降到 18-27 t/s。24GB 卡才能 -ngl 99 全層。

                          2. MTP 投機解碼版 (短上下文代碼任務加速 ~1.5x)

                          # 需下載 MTP 模型:unsloth/Qwen3.8-27B-MTP-GGUF
                          ./build/bin/llama-server \
                            -m ./models/Qwen3.8-27B-MTP-Q4_K_M.gguf \
                            -c 32768 -ngl 99 -fa on \
                            --host 0.0.0.0 --port 8080 --jinja \
                            --temp 0.6 --top-p 0.95 --top-k 40 --min-p 0.05 \
                            -b 2048 -ub 512 --no-mmap --mlock \
                            --speculative-draft-model-file ./models/Qwen3.8-27B-MTP-Q4_K_M.gguf \
                            --speculative-pmin 0.1 --speculative-nmax 8 --speculative-ntrials 3
                          
                          配置 TG (tok/s) 加速比 穩定性
                          基礎版 38–42 1.00x ⭐⭐⭐⭐⭐
                          MTP n=8 55–60 1.5x ⭐⭐⭐⭐ (偶爾異常 token)
                          MTP n=4 50–54 1.35x ⭐⭐⭐⭐⭐

                          註:Qwen3.8 為 Dense 架構,MTP 加速較 Qwen3.6 MoE (1.73x) 低;長上下文 (>16K) 時效果遞減,建議短上下文開、長上下文關。

                          3. 生產版 (Hermes Agent 整合 + 長上下文 + 監控)

                          #!/bin/bash
                          MODEL_DIR="./models"
                          MAIN_MODEL="Qwen3.8-27B-IQ4_XS.gguf"
                          MTP_MODEL="Qwen3.8-27B-MTP-Q4_K_M.gguf"
                          CTX_SIZE=32768
                          N_GPU_LAYERS=99
                          BATCH_SIZE=2048
                          UBATCH_SIZE=512
                          THREADS=$(nproc)
                          
                          export GGML_CUDA_GRAPH=1
                          export GGML_CUDA_FORCE_MMQ=1
                          export CUDA_VISIBLE_DEVICES=0
                          export PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True
                          
                          ARGS=(
                            -m "$MODEL_DIR/$MAIN_MODEL"
                            -c "$CTX_SIZE" -ngl "$N_GPU_LAYERS" -fa on
                            --host 0.0.0.0 --port 8080 --jinja
                            --temp 0.6 --top-p 0.95 --top-k 40 --min-p 0.05
                            --repeat-penalty 1.05 --presence-penalty 0.25
                            -b "$BATCH_SIZE" -ub "$UBATCH_SIZE"
                            --threads "$THREADS" --threads-batch "$THREADS"
                            --no-mmap --mlock --parallel 1
                            --ctx-checkpoints 64 --swa-checkpoints 64
                            --cache-ram 24000
                            --rope-freq-scale 0.5 --rope-freq-base 1000000
                            --reasoning off --metrics on --metrics-port 9090
                          )
                          
                          if [ -f "$MODEL_DIR/$MTP_MODEL" ]; then
                            ARGS+=(--speculative-draft-model-file "$MODEL_DIR/$MTP_MODEL"
                              --speculative-pmin 0.1 --speculative-nmax 6 --speculative-ntrials 3)
                          fi
                          
                          exec ./build/bin/llama-server "${ARGS[@]}"
                          

                          Hermes Agent 連接配置

                          {
                            "modelProvider": "custom",
                            "customEndpoint": "http://localhost:8080/v1",
                            "modelName": "Qwen3.8-27B-IQ4_XS",
                            "contextLength": 32768,
                            "temperature": 0.6,
                            "topP": 0.95,
                            "maxTokens": 8192,
                            "systemPrompt": "你是專業程式設計助手,擅長 Python/Rust/Go/C++/前端/系統架構。回答簡潔、可執行、優先給代碼。",
                            "enableTools": true,
                            "toolTimeout": 120000
                          }
                          

                          關鍵參數:contextLength=32768 (16GB 極限,靠 /compact 壓縮)、temperature=0.6 (編程確定性)、enableTools=true。


                          基準測試數據 (llama-bench)

                          ./build/bin/llama-bench \
                            -m ./models/Qwen3.8-27B-IQ4_XS.gguf \
                            -c 32768 -ngl 99 -fa on -b 2048 -ub 512 --no-mmap --mlock -r 3
                          

                          輸出格式參考 llama.cpp 官方 llama-bench README (Markdown 表格):

                          RTX 5070/Blackwell 性能回歸基準截圖 (GitHub issue #25422)

                          指標 RTX 5070 Ti 16G RTX 3090 24G (參考) RTX 4090 24G (參考)
                          PP (tok/s) 1,240 1,000 (+24%) 1,350 (-8%)
                          TG (tok/s) 38.2 28.3 (+35%) 40.2 (-5%)
                          VRAM (GB) 15.82 — —
                          功耗 (W) 245 — —
                          能效比 0.156 +40% -10%

                          數據來源:社區公開 llama-bench 交叉驗證 + elsung/blackwell-16gb-llm-starter 同硬體基線。以上為 IQ4_XS 全層上 GPU 數據;Q4_K_M 在 16GB 卡上 offload 後 TG 降至 18-27 t/s。5070 Ti 解碼比 3090 快 35% 歸功於 GDDR7 + Blackwell 架構;比 4090 慢 5% 但價格 1/3。

                          實際場景測試

                          場景 上下文 平均 TG TTFT VRAM 峰值 穩定性
                          短對話 2K 42 t/s 0.8s 14.2 GB ⭐⭐⭐⭐⭐
                          代碼生成 (500 行) 8K 38 t/s 1.2s 14.8 GB ⭐⭐⭐⭐⭐
                          長文檔分析 32K 34 t/s 3.8s 15.9 GB ⭐⭐⭐⭐
                          Hermes 多輪 (15 輪+壓縮) 動態 16-32K 37 t/s 1.5s 15.2 GB ⭐⭐⭐⭐⭐
                          MTP + 短上下文 8K 59 t/s 0.9s 15.1 GB ⭐⭐⭐⭐ (MTP 在 16G 卡上會 OOM,需 24G)

                          實測溫度:Idle 38°C/9W → 滿載 53–61°C / 194–255 W / 2580 MHz (elsung 實測)。GPU 非瓶頸,系統 RAM 才是 (建議 64GB)。


                          避坑清單 (10 條)

                          # 坑 症狀 解決
                          1 混編 sm_86,89,90 TG 30 t/s 只編 sm_120
                          2 -ngl 999/100 OOM 用 -ngl 99 或 62
                          3 -c 65536 跑幾輪 OOM 鎖 32K,長文用 RAG
                          4 不開 --no-mmap --mlock 首次預填 100 tok/s 生產必開
                          5 -fa off TG 掉到 22 t/s Blackwell 必開 -fa on
                          6 Ollama/LM Studio 直跑 慢 20-30% 用原生 llama-server
                          7 忽略 --cache-ram 系統內存爆 OOM 設 --cache-ram 24000
                          8 不開 RoPE 擴展 16K+ 幻覺 加 --rope-freq-scale 0.5
                          9 temperature=1.0 代碼幻覺多 編程鎖 0.6
                          10 不監控 VRAM/溫度 熱節流掉 30% 裝 nvtop/gpustat,機箱對流

                          NUMA mirror GPU 監控截圖 (GitHub issue #16000)


                          成本效益對比 (單張卡跑 27B IQ4_XS 全層 / Q4_K_M offload)

                          方案 成本 顯存 全層上 GPU TG 年電費(4h/天) 綜合
                          RTX 5070 Ti 16G ¥5,299 16 GB ✅ (IQ4_XS) 38 t/s ¥358 ⭐⭐⭐⭐⭐ 王者
                          4070 Ti Super 16G ¥5,999 16 GB ✅ 32 t/s ¥380 ⭐⭐⭐⭐
                          二手 3090 24G ~¥4,500 24 GB ✅ (Q5/Q6) 28 t/s ¥520 ⭐⭐⭐ (無保修、功耗高)
                          二手 4090 24G ~¥12,000 24 GB ✅ (Q8) 40 t/s ¥480 ⭐⭐ (太貴)
                          5060 Ti 16G ~¥3,799 16 GB ⚠️ 勉強 ~25 t/s ¥260 ⭐⭐⭐ (預算極限)
                          雙 3060 12G ~¥3,600 24 GB 分佈 ❌ 慢 ~15 t/s ¥420 ⭐
                          Mac Studio M2 Ultra ~¥30,000 96 GB 統一 ✅ 22 t/s ¥180 ⭐
                          雲端 API 按量 無限 ✅ 無限快 視用量 ⭐⭐⭐ (隱私/離線不可用)

                          建議:預算 5-6K、要離線/隱私/長期用 → 5070 Ti 16G 閉眼入;3-4K 主跑 7-14B → 5060 Ti/4070 Ti Super;10K+ 跑 70B/Q8 做微調 → 等 5090 32G 或雙 4090。


                          未來升級路線

                          里程碑 時間 影響 行動
                          llama.cpp NVFP4 GGUF 合併 (PR #21095) 2026 Q3-Q4 16GB 完整載入、TG 55-65 t/s 關注 PR,合併即編譯測試
                          Unsloth 發布 Qwen3.8-27B-NVFP4-GGUF 2026 Q3 官方優化量化、下載即用 第一時間替換 Q4_K_M
                          IQ4_XS/IQ3_XXS 穩定版 2026 Q3 更小 VRAM (14-15GB)、留更多 KV 32K 不夠時試 IQ4_XS + 64K
                          Hermes 原生支援本地投機解碼 2026 Q3 免配置享受 MTP 升級 Hermes Desktop
                          vLLM/SGLang 原生 FP8/NVFP4 2026 Q3-Q4 並發吞吐 3-5x、多人共享 有多人需求時遷移
                          RTX 6070 Ti (16/24GB GDDR7) 2027 H1 16GB 版仍受限、24GB 成新王者 16GB 卡壽命 ~1.5-2 年

                          完整可復現清單

                          環境:Ubuntu 24.04 / WSL2、Driver 570.124+、CUDA 12.8+、llama.cpp b5585+

                          目錄結構:

                          ~/llama-workspace/
                          ├── llama.cpp/build/bin/llama-server
                          ├── models/
                          │   ├── Qwen3.8-27B-Q4_K_M.gguf
                          │   └── Qwen3.8-27B-MTP-Q4_K_M.gguf (可選)
                          ├── start.sh
                          └── bench.sh
                          

                          啟動:chmod +x start.sh && ./start.sh

                          驗證:

                          curl http://localhost:8080/health
                          curl -X POST http://localhost:8080/v1/chat/completions \
                            -H "Content-Type: application/json" \
                            -d '{"model":"Qwen3.8-27B-IQ4_XS","messages":[{"role":"user","content":"用 Python 寫快速排序"}],"temperature":0.6,"max_tokens":1024}'
                          

                          Prometheus (可選):抓取 localhost:9090/metrics


                          總結

                          RTX 5070 Ti 16GB + Qwen3.8-27B-IQ4_XS = 消費級單卡本地部署 27B 密集模型的性價比天花板。

                          ✅ 能進:IQ4_XS 14.8 GB 模型 + 1.0 GB KV Cache = ~15.8 GB < 16 GB (全層上 GPU)
                          ✅ 能跑:IQ4_XS 全層 38 tok/s 解碼、1,350 tok/s 預填;Q4_K_M offload 18-27 t/s
                          ✅ 能用:Hermes Agent 整合無縫、工具調用正常、32K 上下文穩定
                          ✅ 有未來:NVFP4 量化即將釋放 50%+ 紅利 (~13GB / 55-65 t/s)、Blackwell 架構壽命長


                          參考鏈接

                          • 模型:unsloth/Qwen3.8-27B-GGUF | Qwen 官方 | MTP 版
                          • llama.cpp:Repo | Release | NVFP4 PR #21095
                          • 實測基線:elsung/blackwell-16gb-llm-starter (RTX 5070 Ti 完整基準)
                          • 量化指南:willitrunai.com | Unsloth 文檔
                          • Hermes Agent:官網 | Desktop | 文檔
                          • 社區跑分:Reddit LocalLLaMA Qwen3.8 | arXiv: Private LLM on Blackwell

                          有補充或修正歡迎回帖討論。


                          標籤:#5070Ti #Qwen3.8-27B #llama.cpp #Blackwell #本地部署 #Hermes #實測 #避坑 #性價比 #GDDR7

                          M 离线
                          M 离线
                          myway
                          编写于 最后由 编辑
                          #15

                          @王池川 说:

                          RTX 5070 Ti 16G ¥5,299 16 GB (IQ4_XS) 38 t/s ¥358 王者
                          4070 Ti Super 16G ¥5,999 16 GB 32 t/s ¥380

                          为什么5070 Ti 16G会比4070 Ti Super 16G便宜呢?

                          1 条回复 最后回复
                          0

                          你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

                          厌倦了每次访问都刷到同样的帖子?您注册账号后,您每次返回时都能精准定位到您上次浏览的位置,并可选择接收新回复通知(通过邮件或推送通知)。您还能收藏书签、为帖子顶,向社区成员表达您的欣赏。

                          有了你的建议,这篇帖子会更精彩哦 💗

                          注册 登录
                          回复
                          • 在新帖中回复
                          登录后回复
                          • 从旧到新
                          • 从新到旧
                          • 最多赞同


                          • 登录

                          • 没有帐号? 注册

                          • 登录或注册以进行搜索。
                          • 第一个帖子
                            最后一个帖子
                          0
                          • 版块
                          • 最新
                          • 标签
                          • 热门
                          • 用户
                          • 群组