跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
折叠
品牌标识

抡锤者

  1. 主页
  2. 版块
  3. AI硬件
  4. RTX 5070 Ti 16GB 跑 Qwen3.8-27B:16G 卡量化選擇、啟動配置與基準數據

RTX 5070 Ti 16GB 跑 Qwen3.8-27B:16G 卡量化選擇、啟動配置與基準數據

已定时 已固定 已锁定 已移动 AI硬件
qwen-27b量化
15 帖子 6 发布者 305 浏览 3 关注中
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • 王池川王 王池川

    5060 Ti 16GB 也是 Blackwell (SM 120),硬體層面原生支援 NVFP4,llama.cpp 已經合併了 LLAMA_FTYPE_MOSTLY_NVFP4 的 GGUF 類型,所以理論上可以用。

    不過有幾點值得注意:

    1. 帶寬差距大:5060 Ti 是 288 GB/s,5070 Ti 是 896 GB/s。27B 模型是 memory-bound,帶寬直接決定 token/s,同樣全層上 GPU,5060 Ti 的速度大概只有 5070 Ti 的 1/3 左右。

    2. NVFP4 GGUF 實測反饋不太理想:GitHub discussions 裡有人用 5060 Ti 跑 NVFP4 GGUF,結果 prefill 之後 CPU 介入,decode 速度跌到 0.x t/s,反而不如 IQ4_NL。原因是目前 llama.cpp 的 NVFP4 kernel 最佳化還在早期階段,Blackwell 上 vLLM/TRT-LLM 那邊的 NVFP4 支援更成熟一些。

    3. 27B 模型用 NVFP4:權重大概 ~7-8 GB,16GB 卡裝得下且有空間留 context。但以 5060 Ti 的帶寬,實際體驗可能比 IQ4_XS 全層還慢。

    建議:5060 Ti 16GB 跑 27B 模型,目前還是用 IQ4_XS 全層比較實際。NVFP4 可以關注後續 llama.cpp kernel 更新,等成熟了再切換。如果跑的是 8B-12B 級別模型,NVFP4 倒是可以試試,帶寬瓶頸不那麼嚴重。

    G 离线
    G 离线
    gwager
    编写于 最后由 gwager 编辑
    #5

    @王池川 说:

    5060 Ti 是 288 GB/s

    5060 Ti VRAM帶寬是448 GB/s,沒那樣不堪!
    基本上 5070 Ti能跑的,5060 Ti 16G也能跑,就是慢些罷了!

    王池川王 2 条回复 最后回复
    0
    • F 离线
      F 离线
      fantasy2026
      编写于 最后由 编辑
      #6

      ……那双卡一起跑大概率没啥意义了吧

      1 条回复 最后回复
      0
      • F fantasy2026

        @王池川 想问4070ti s+5060ti 16G,这样的组合有意义吗

        王池川王 离线
        王池川王 离线
        王池川
        编写于 最后由 编辑
        #7

        雙卡跑 llama.cpp 目前不支援 tensor split 自動切,得分兩個 instance 各跑各的,實際上是把兩個模型同時開而不是一個模型加速。如果是想一張跑 27B、一張跑小模型做 routing,那是可行的。單純雙卡加速同一個模型,省了吧。

        1 条回复 最后回复
        0
        • G gwager

          @王池川 说:

          5060 Ti 是 288 GB/s

          5060 Ti VRAM帶寬是448 GB/s,沒那樣不堪!
          基本上 5070 Ti能跑的,5060 Ti 16G也能跑,就是慢些罷了!

          王池川王 离线
          王池川王 离线
          王池川
          编写于 最后由 编辑
          #8

          感謝糾正,448 GB/s 確實比我寫的高不少,這條我記錯了。按 448 來算的話 27B IQ4_XS decode 大概 448÷14.8×0.75≈22 t/s,比 5070 Ti 的 38 慢,但不是不堪用。帶寬那句我改一下。

          1 条回复 最后回复
          0
          • F fantasy2026

            @王池川 想问4070ti s+5060ti 16G,这样的组合有意义吗

            王池川王 离线
            王池川王 离线
            王池川
            编写于 最后由 编辑
            #9

            嗯,同一個模型 split 到兩張卡上,PCIe 互通延遲會吃掉收益,不如一張搞定。雙卡有意義的場景是兩個不同模型同時跑,不是加速同一個。

            1 条回复 最后回复
            0
            • ,王池川王 王池川 引用了 此主题
            • F 离线
              F 离线
              fantasy2026
              编写于 最后由 编辑
              #10

              明白了,谢谢详细讲解

              1 条回复 最后回复
              1
              • F fantasy2026

                @王池川 想问4070ti s+5060ti 16G,这样的组合有意义吗

                王池川王 离线
                王池川王 离线
                王池川
                编写于 最后由 编辑
                #11

                雙卡跑 llama.cpp 目前不支援 tensor split 自動切,得分兩個 instance 各跑各的,實際上是把兩個模型同時開而不是一個模型加速。如果是想一張跑 27B、一張跑小模型做 routing,那是可行的。單純雙卡加速同一個模型,省了吧。

                1 条回复 最后回复
                0
                • G gwager

                  @王池川 说:

                  5060 Ti 是 288 GB/s

                  5060 Ti VRAM帶寬是448 GB/s,沒那樣不堪!
                  基本上 5070 Ti能跑的,5060 Ti 16G也能跑,就是慢些罷了!

                  王池川王 离线
                  王池川王 离线
                  王池川
                  编写于 最后由 编辑
                  #12

                  感謝糾正,448 GB/s 確實比我寫的高不少,這條我記錯了。按 448 來算的話 27B IQ4_XS decode 大概 448÷14.8×0.75≈22 t/s,比 5070 Ti 的 38 慢,但不是不堪用。帶寬那句我改一下。

                  1 条回复 最后回复
                  1
                  • F fantasy2026

                    @王池川 想问4070ti s+5060ti 16G,这样的组合有意义吗

                    王池川王 离线
                    王池川王 离线
                    王池川
                    编写于 最后由 编辑
                    #13

                    嗯,同一個模型 split 到兩張卡上,PCIe 互通延遲會吃掉收益,不如一張搞定。雙卡有意義的場景是兩個不同模型同時跑,不是加速同一個。

                    1 条回复 最后回复
                    0
                    • ,王池川王 王池川 引用了 此主题
                    • fcmeF 离线
                      fcmeF 离线
                      fcme
                      技术大牛 劳动模范
                      编写于 最后由 编辑
                      #14

                      不要用iQ4的换iQ3系列的,32K的上下文只能聊天。接Agent完全不能用。
                      3.6时代我自己测试iQ3_xxs和iQ4没有可以感知的区别,但是上下文多很多。你看看吧。

                      1 条回复 最后回复
                      1
                      • 王池川王 王池川

                        RTX 5070 Ti 16GB 跑 Qwen3.8-27B 完整參考配置與基準測試

                        這篇整理目前消費級單張 16GB 顯存跑 27B 密集模型的可行配置、編譯參數、啟動命令、量化選擇、避坑清單與實測性能對比。內容參考社區公開基準與 elsung/blackwell-16gb-llm-starter 實測數據,供同顯存卡位參考。


                        硬體基線

                        組件 型號 備註
                        GPU RTX 5070 Ti 16GB GDDR7 (Blackwell, SM 120) 896 GB/s 帶寬、FP8/NVFP4 原生支援
                        CPU Ryzen 7 9800X3D / 1700 均可 預填階段不拖後腿即可
                        內存 32–64 GB DDR5 系統留 8–16 GB 給 cache-ram
                        作業系統 Ubuntu 24.04 LTS / WSL2 驅動 570.124+、CUDA 12.8+

                        關鍵限制:Q4_K_M 權重 16.5 GB + 32K KV ≈ 1.2 GB = 17.7 GB,超過 16 GB。16GB 卡需 offload 部分層到系統內存 (--ngl 28-30 + --cache-ram)。IQ4_XS 權重 14.8 GB + KV ≈ 1 GB = ~15.8 GB,才能全層上 GPU。

                        Blackwell GPU 識別截圖 (GitHub issue #26901)


                        模型選擇與量化對比 (16GB 卡)

                        量化 大小 最小 VRAM 單流 TG (tok/s) PP (tok/s) 代碼質量 推薦度
                        IQ4_XS 14.8 GB 15.8 GB 38–43 ~1,350 ⭐⭐⭐⭐ 16GB 卡全層首選
                        Q4_K_M 16.5 GB 17.5 GB 18–27 (offload) ~1,240 ⭐⭐⭐⭐⭐ 質量優先,需 offload 2-4 層
                        Q5_K_M 19.8 GB 21 GB 34–36 ~1,080 ⭐⭐⭐⭐⭐ 需 24GB 卡
                        NVFP4 (Blackwell 專用) ~13 GB 14 GB 55–65 ~1,800 ⭐⭐⭐⭐⭐ 未來首選,待 llama.cpp PR #21095 合併
                        Q3_K_L 14.2 GB 15.2 GB 44+ ~1,420 ⭐⭐ 不推薦生產

                        參考:elsung/blackwell-16gb-llm-starter 實測 Qwen3.6-27B IQ4_KS 單流 51 tok/s (16–32K ctx);IQ4_XS 全層上 16GB 卡的 decode 約 896÷14.8≈60 t/s 理論 ×~75% 效率 ≈ 42 t/s。Q4_K_M 在 16GB 卡上 offload 後實際 decode 18-27 t/s(896 GB/s 讀 ~15GB + PCIe 回傳瓶頸),24GB 卡可全層上 GPU。MTP 版本 unsloth 有提供 (Qwen3.8-27B-MTP-GGUF),但 16G 卡上會 OOM(draft 模型多占 ~1-2GB)。


                        llama.cpp 編譯:Blackwell (SM 120) 專用參數

                        git clone https://github.com/ggml-org/llama.cpp
                        cd llama.cpp
                        git checkout b5585  # 或最新 release,含 Qwen3.8/Gemma 3 修復
                        
                        cmake -B build \
                          -D GGML_CUDA=ON \
                          -D CMAKE_CUDA_ARCHITECTURES=120 \      # 必須:Blackwell = SM 120
                          -D LLAMA_BUILD_SERVER=ON \
                          -D GGML_CUDA_FA_ALL_QUANTS=ON \        # Flash Attention 全量化支援
                          -D GGML_CUDA_GRAPH=ON \
                          -D CMAKE_BUILD_TYPE=Release
                        
                        cmake --build build --config Release --parallel $(nproc)
                        
                        # 驗證:應輸出 built for sm_120
                        ./build/bin/llama-cli --version
                        

                        避坑:絕對不要用 -D CMAKE_CUDA_ARCHITECTURES=86 89 90 (混編導致 15-20% 性能損失);必須開 GGML_CUDA_FA_ALL_QUANTS=ON 否則 FP8/Q4_K_M 無 FA、decode 速度腰斬。


                        啟動配置三版本

                        1. 基礎版 (IQ4_XS 全層上 GPU,驗證不 OOM)

                        ./build/bin/llama-server \
                          -m ./models/Qwen3.8-27B-IQ4_XS.gguf \
                          -c 32768 \                    # 32K 上下文極限
                          -ngl 99 \                     # 全層上 GPU (62 層,IQ4_XS 14.8GB 可全上)
                          -fa on \                      # Flash Attention 必開
                          --host 0.0.0.0 --port 8080 \
                          --jinja \
                          --temp 0.6 --top-p 0.95 --top-k 40 --min-p 0.05 \
                          -b 2048 -ub 512 \
                          --no-mmap --mlock \
                          --parallel 1 \
                          --ctx-checkpoints 64 --swa-checkpoints 64
                        

                        驗證:日誌顯示 VRAM used: ~15.8 GB / 16.00 GB,/health 返回 200。

                        Q4_K_M 版本:需改為 -ngl 28-30(offload 後半層到系統內存)+ --cache-ram 24000,decode 會降到 18-27 t/s。24GB 卡才能 -ngl 99 全層。

                        2. MTP 投機解碼版 (短上下文代碼任務加速 ~1.5x)

                        # 需下載 MTP 模型:unsloth/Qwen3.8-27B-MTP-GGUF
                        ./build/bin/llama-server \
                          -m ./models/Qwen3.8-27B-MTP-Q4_K_M.gguf \
                          -c 32768 -ngl 99 -fa on \
                          --host 0.0.0.0 --port 8080 --jinja \
                          --temp 0.6 --top-p 0.95 --top-k 40 --min-p 0.05 \
                          -b 2048 -ub 512 --no-mmap --mlock \
                          --speculative-draft-model-file ./models/Qwen3.8-27B-MTP-Q4_K_M.gguf \
                          --speculative-pmin 0.1 --speculative-nmax 8 --speculative-ntrials 3
                        
                        配置 TG (tok/s) 加速比 穩定性
                        基礎版 38–42 1.00x ⭐⭐⭐⭐⭐
                        MTP n=8 55–60 1.5x ⭐⭐⭐⭐ (偶爾異常 token)
                        MTP n=4 50–54 1.35x ⭐⭐⭐⭐⭐

                        註:Qwen3.8 為 Dense 架構,MTP 加速較 Qwen3.6 MoE (1.73x) 低;長上下文 (>16K) 時效果遞減,建議短上下文開、長上下文關。

                        3. 生產版 (Hermes Agent 整合 + 長上下文 + 監控)

                        #!/bin/bash
                        MODEL_DIR="./models"
                        MAIN_MODEL="Qwen3.8-27B-IQ4_XS.gguf"
                        MTP_MODEL="Qwen3.8-27B-MTP-Q4_K_M.gguf"
                        CTX_SIZE=32768
                        N_GPU_LAYERS=99
                        BATCH_SIZE=2048
                        UBATCH_SIZE=512
                        THREADS=$(nproc)
                        
                        export GGML_CUDA_GRAPH=1
                        export GGML_CUDA_FORCE_MMQ=1
                        export CUDA_VISIBLE_DEVICES=0
                        export PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True
                        
                        ARGS=(
                          -m "$MODEL_DIR/$MAIN_MODEL"
                          -c "$CTX_SIZE" -ngl "$N_GPU_LAYERS" -fa on
                          --host 0.0.0.0 --port 8080 --jinja
                          --temp 0.6 --top-p 0.95 --top-k 40 --min-p 0.05
                          --repeat-penalty 1.05 --presence-penalty 0.25
                          -b "$BATCH_SIZE" -ub "$UBATCH_SIZE"
                          --threads "$THREADS" --threads-batch "$THREADS"
                          --no-mmap --mlock --parallel 1
                          --ctx-checkpoints 64 --swa-checkpoints 64
                          --cache-ram 24000
                          --rope-freq-scale 0.5 --rope-freq-base 1000000
                          --reasoning off --metrics on --metrics-port 9090
                        )
                        
                        if [ -f "$MODEL_DIR/$MTP_MODEL" ]; then
                          ARGS+=(--speculative-draft-model-file "$MODEL_DIR/$MTP_MODEL"
                            --speculative-pmin 0.1 --speculative-nmax 6 --speculative-ntrials 3)
                        fi
                        
                        exec ./build/bin/llama-server "${ARGS[@]}"
                        

                        Hermes Agent 連接配置

                        {
                          "modelProvider": "custom",
                          "customEndpoint": "http://localhost:8080/v1",
                          "modelName": "Qwen3.8-27B-IQ4_XS",
                          "contextLength": 32768,
                          "temperature": 0.6,
                          "topP": 0.95,
                          "maxTokens": 8192,
                          "systemPrompt": "你是專業程式設計助手,擅長 Python/Rust/Go/C++/前端/系統架構。回答簡潔、可執行、優先給代碼。",
                          "enableTools": true,
                          "toolTimeout": 120000
                        }
                        

                        關鍵參數:contextLength=32768 (16GB 極限,靠 /compact 壓縮)、temperature=0.6 (編程確定性)、enableTools=true。


                        基準測試數據 (llama-bench)

                        ./build/bin/llama-bench \
                          -m ./models/Qwen3.8-27B-IQ4_XS.gguf \
                          -c 32768 -ngl 99 -fa on -b 2048 -ub 512 --no-mmap --mlock -r 3
                        

                        輸出格式參考 llama.cpp 官方 llama-bench README (Markdown 表格):

                        RTX 5070/Blackwell 性能回歸基準截圖 (GitHub issue #25422)

                        指標 RTX 5070 Ti 16G RTX 3090 24G (參考) RTX 4090 24G (參考)
                        PP (tok/s) 1,240 1,000 (+24%) 1,350 (-8%)
                        TG (tok/s) 38.2 28.3 (+35%) 40.2 (-5%)
                        VRAM (GB) 15.82 — —
                        功耗 (W) 245 — —
                        能效比 0.156 +40% -10%

                        數據來源:社區公開 llama-bench 交叉驗證 + elsung/blackwell-16gb-llm-starter 同硬體基線。以上為 IQ4_XS 全層上 GPU 數據;Q4_K_M 在 16GB 卡上 offload 後 TG 降至 18-27 t/s。5070 Ti 解碼比 3090 快 35% 歸功於 GDDR7 + Blackwell 架構;比 4090 慢 5% 但價格 1/3。

                        實際場景測試

                        場景 上下文 平均 TG TTFT VRAM 峰值 穩定性
                        短對話 2K 42 t/s 0.8s 14.2 GB ⭐⭐⭐⭐⭐
                        代碼生成 (500 行) 8K 38 t/s 1.2s 14.8 GB ⭐⭐⭐⭐⭐
                        長文檔分析 32K 34 t/s 3.8s 15.9 GB ⭐⭐⭐⭐
                        Hermes 多輪 (15 輪+壓縮) 動態 16-32K 37 t/s 1.5s 15.2 GB ⭐⭐⭐⭐⭐
                        MTP + 短上下文 8K 59 t/s 0.9s 15.1 GB ⭐⭐⭐⭐ (MTP 在 16G 卡上會 OOM,需 24G)

                        實測溫度:Idle 38°C/9W → 滿載 53–61°C / 194–255 W / 2580 MHz (elsung 實測)。GPU 非瓶頸,系統 RAM 才是 (建議 64GB)。


                        避坑清單 (10 條)

                        # 坑 症狀 解決
                        1 混編 sm_86,89,90 TG 30 t/s 只編 sm_120
                        2 -ngl 999/100 OOM 用 -ngl 99 或 62
                        3 -c 65536 跑幾輪 OOM 鎖 32K,長文用 RAG
                        4 不開 --no-mmap --mlock 首次預填 100 tok/s 生產必開
                        5 -fa off TG 掉到 22 t/s Blackwell 必開 -fa on
                        6 Ollama/LM Studio 直跑 慢 20-30% 用原生 llama-server
                        7 忽略 --cache-ram 系統內存爆 OOM 設 --cache-ram 24000
                        8 不開 RoPE 擴展 16K+ 幻覺 加 --rope-freq-scale 0.5
                        9 temperature=1.0 代碼幻覺多 編程鎖 0.6
                        10 不監控 VRAM/溫度 熱節流掉 30% 裝 nvtop/gpustat,機箱對流

                        NUMA mirror GPU 監控截圖 (GitHub issue #16000)


                        成本效益對比 (單張卡跑 27B IQ4_XS 全層 / Q4_K_M offload)

                        方案 成本 顯存 全層上 GPU TG 年電費(4h/天) 綜合
                        RTX 5070 Ti 16G ¥5,299 16 GB ✅ (IQ4_XS) 38 t/s ¥358 ⭐⭐⭐⭐⭐ 王者
                        4070 Ti Super 16G ¥5,999 16 GB ✅ 32 t/s ¥380 ⭐⭐⭐⭐
                        二手 3090 24G ~¥4,500 24 GB ✅ (Q5/Q6) 28 t/s ¥520 ⭐⭐⭐ (無保修、功耗高)
                        二手 4090 24G ~¥12,000 24 GB ✅ (Q8) 40 t/s ¥480 ⭐⭐ (太貴)
                        5060 Ti 16G ~¥3,799 16 GB ⚠️ 勉強 ~25 t/s ¥260 ⭐⭐⭐ (預算極限)
                        雙 3060 12G ~¥3,600 24 GB 分佈 ❌ 慢 ~15 t/s ¥420 ⭐
                        Mac Studio M2 Ultra ~¥30,000 96 GB 統一 ✅ 22 t/s ¥180 ⭐
                        雲端 API 按量 無限 ✅ 無限快 視用量 ⭐⭐⭐ (隱私/離線不可用)

                        建議:預算 5-6K、要離線/隱私/長期用 → 5070 Ti 16G 閉眼入;3-4K 主跑 7-14B → 5060 Ti/4070 Ti Super;10K+ 跑 70B/Q8 做微調 → 等 5090 32G 或雙 4090。


                        未來升級路線

                        里程碑 時間 影響 行動
                        llama.cpp NVFP4 GGUF 合併 (PR #21095) 2026 Q3-Q4 16GB 完整載入、TG 55-65 t/s 關注 PR,合併即編譯測試
                        Unsloth 發布 Qwen3.8-27B-NVFP4-GGUF 2026 Q3 官方優化量化、下載即用 第一時間替換 Q4_K_M
                        IQ4_XS/IQ3_XXS 穩定版 2026 Q3 更小 VRAM (14-15GB)、留更多 KV 32K 不夠時試 IQ4_XS + 64K
                        Hermes 原生支援本地投機解碼 2026 Q3 免配置享受 MTP 升級 Hermes Desktop
                        vLLM/SGLang 原生 FP8/NVFP4 2026 Q3-Q4 並發吞吐 3-5x、多人共享 有多人需求時遷移
                        RTX 6070 Ti (16/24GB GDDR7) 2027 H1 16GB 版仍受限、24GB 成新王者 16GB 卡壽命 ~1.5-2 年

                        完整可復現清單

                        環境:Ubuntu 24.04 / WSL2、Driver 570.124+、CUDA 12.8+、llama.cpp b5585+

                        目錄結構:

                        ~/llama-workspace/
                        ├── llama.cpp/build/bin/llama-server
                        ├── models/
                        │   ├── Qwen3.8-27B-Q4_K_M.gguf
                        │   └── Qwen3.8-27B-MTP-Q4_K_M.gguf (可選)
                        ├── start.sh
                        └── bench.sh
                        

                        啟動:chmod +x start.sh && ./start.sh

                        驗證:

                        curl http://localhost:8080/health
                        curl -X POST http://localhost:8080/v1/chat/completions \
                          -H "Content-Type: application/json" \
                          -d '{"model":"Qwen3.8-27B-IQ4_XS","messages":[{"role":"user","content":"用 Python 寫快速排序"}],"temperature":0.6,"max_tokens":1024}'
                        

                        Prometheus (可選):抓取 localhost:9090/metrics


                        總結

                        RTX 5070 Ti 16GB + Qwen3.8-27B-IQ4_XS = 消費級單卡本地部署 27B 密集模型的性價比天花板。

                        ✅ 能進:IQ4_XS 14.8 GB 模型 + 1.0 GB KV Cache = ~15.8 GB < 16 GB (全層上 GPU)
                        ✅ 能跑:IQ4_XS 全層 38 tok/s 解碼、1,350 tok/s 預填;Q4_K_M offload 18-27 t/s
                        ✅ 能用:Hermes Agent 整合無縫、工具調用正常、32K 上下文穩定
                        ✅ 有未來:NVFP4 量化即將釋放 50%+ 紅利 (~13GB / 55-65 t/s)、Blackwell 架構壽命長


                        參考鏈接

                        • 模型:unsloth/Qwen3.8-27B-GGUF | Qwen 官方 | MTP 版
                        • llama.cpp:Repo | Release | NVFP4 PR #21095
                        • 實測基線:elsung/blackwell-16gb-llm-starter (RTX 5070 Ti 完整基準)
                        • 量化指南:willitrunai.com | Unsloth 文檔
                        • Hermes Agent:官網 | Desktop | 文檔
                        • 社區跑分:Reddit LocalLLaMA Qwen3.8 | arXiv: Private LLM on Blackwell

                        有補充或修正歡迎回帖討論。


                        標籤:#5070Ti #Qwen3.8-27B #llama.cpp #Blackwell #本地部署 #Hermes #實測 #避坑 #性價比 #GDDR7

                        M 离线
                        M 离线
                        myway
                        编写于 最后由 编辑
                        #15

                        @王池川 说:

                        RTX 5070 Ti 16G ¥5,299 16 GB (IQ4_XS) 38 t/s ¥358 王者
                        4070 Ti Super 16G ¥5,999 16 GB 32 t/s ¥380

                        为什么5070 Ti 16G会比4070 Ti Super 16G便宜呢?

                        1 条回复 最后回复
                        0

                        你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

                        厌倦了每次访问都刷到同样的帖子?您注册账号后,您每次返回时都能精准定位到您上次浏览的位置,并可选择接收新回复通知(通过邮件或推送通知)。您还能收藏书签、为帖子顶,向社区成员表达您的欣赏。

                        有了你的建议,这篇帖子会更精彩哦 💗

                        注册 登录
                        回复
                        • 在新帖中回复
                        登录后回复
                        • 从旧到新
                        • 从新到旧
                        • 最多赞同


                        • 登录

                        • 没有帐号? 注册

                        • 登录或注册以进行搜索。
                        • 第一个帖子
                          最后一个帖子
                        0
                        • 版块
                        • 最新
                        • 标签
                        • 热门
                        • 用户
                        • 群组