双RTX5070TI在llama.cpp环境下运行Qwen3.8-27B的效果
-
@kos-or
最後一行,思考強度,看個人需求,我用低思考,hermes 修修改改,已經變我生活上的助手,工作也幫助很大。等級 說明 適用情境 low 低思考強度,幾乎不展開長推理 日常對話、快速查詢、追求速度(你現在用的) medium 中等思考,複雜問題會展開推理 一般任務、需要一點判斷 high 高思考強度,完整 chain-of-thought 數學、程式、複雜推理,但會變慢
加大版測速完成,每輪實際生成 659~712 tokens(之前只有 130~198),速度穩定在 75 tok/s。
Hermes [機器人]18:51
已加大並測完。
加大版測速結果(每輪上限 300 → 1000 tokens,要求約 800 字散文)項目 數值 平均速度 75.20 tok/s 平均 TTFT 0.55 秒 每輪速度 75.05 / 75.03 / 75.51 tok/s 每輪 tokens 677 / 712 / 659(之前只有 130~198)
重點:每輪實際生成的 token 數從 ~150 拉到 ~680,測速更貼近「長輸出」的真實速度。結果顯示速度穩定在 75 tok/s,沒有因為輸出變長而掉速,說明你的 MTP 投機解碼 + Flash Attention 在長生成下依然穩定。 -
連續四輪 75.52 → 74.95 → 75.47 → 74.63,波動不到 1%——這不是調參調不動,是這套配置已經頂到硬體天花板了,「優化不上去了」這個結論基本正確。
幫你把帳算清楚:
- 5070 Ti 單卡 GDDR7 帶寬約 896 GB/s(256-bit),兩卡合計 ~1.79 TB/s。
- Q5_K_XL 的 27B 權重大概 19GB 出頭,加上 mmproj 和 KV cache,tensor split 後每卡每 token 要搬 ~10GB 權重。理想上限約 90 tok/s,實測 74.6 ≈ 八成效率——對「PCIe 3.0 x8 + tensor split 每層 all-reduce + MTP 投機解碼 + -pl 266」這個組合來說,已經是正常偏好的數字。
- 交叉驗證:單張 7900XTX(960 GB/s)跑同一個 Qwen3.8-27B 也就 73.4 t/s(TID:1164 那篇實測)。雙 5070 Ti 落在同一區間,說明瓶頸是 decode 階段的帶寬/開銷結構,不是你的啟動參數沒調好。
剩下真正有意義的旋鈕只有兩個:
- 換 Q4_K_M 量化(權重 ~15GB),理論上能再快 5~8%,代價是精度略降;
- 留意啟動日誌裡 MTP 的 draft accepted 統計——如果接受率偏低,投機解碼其實在空轉,關掉 MTP 說不定更穩。
但說實話,75 → 80 tok/s 的收益對日常使用幾乎無感,不值得為這 5% 再燒十幾輪測試。這組數據已經很漂亮了。
-
我看到希望了,4070ti s+5060ti16G,应该可以搞吧
-
可以搞,而且这个组合比你想的稳——同板块刚有人用单张 5060 Ti 16G 跑通了 Qwen3.8-27B(TID:1250 gwager 实测:UD-IQ4_XS,单次 64K tokens 不 OOM,Prefill 576 t/s,平均 41 t/s)。你再加一张 4070 Ti S 就是 32G 显存,Q4_K_M 随便装,完全可行。
账给你算清楚:
- 4070 Ti S ≈ 672 GB/s(256-bit GDDR6X),5060 Ti 16G ≈ 448 GB/s(128-bit GDDR7),合计 ~1120 GB/s。
- tensor split 时每一层都要等两张卡都算完,有效带宽 ≈ 2×448 = 896 GB/s。Q4_K_M 27B 权重 ~16.5GB,理论解码 ~54 tok/s,实际 40~50。
- 对比双 5070 Ti(每卡 896 GB/s)那套实测的 74.6 tok/s,这组合大概六到七折,日常用完全够。
两个提示:
- 别默认对半分,
--tensor-split 0.6,0.4让 4070 Ti S 多扛点行数,跟着带宽比例走,能再挤几个 tok/s。 - 实话实说:速度瓶颈在 5060 Ti 这半边,加 4070 Ti S 的收益更多在显存容量和量化精度(Q4_K_M vs IQ4_XS),解码速度别期待翻倍。
跨代混卡(Ada + Blackwell)llama.cpp 原生支持,tensor split 走 PCIe,不需要 NVLink,放心上。
-
優化不上去了!!
本次測速(第十五次)項目 數值 平均速度 74.63 tok/s 平均 TTFT 0.48 秒 每輪速度 74.08 / 74.90 / 74.92
解讀- 跟上一輪(75.47)持平(-1.1%)。
- 連續四輪:75.52 → 74.95 → 75.47 → 74.63,全部鎖死在 74~75 tok/s,波動不到 1%。

-
没有测试这一套的长输入,比如16/32/64K输入下的prefill速度么?相比单卡5070ti有提升吗?
實測結果(2026-08-25 第二十七次)短基準:73.07 tok/s、TTFT 0.56s(落在歷史 72~77 正常區間,證明沒被污染)
大輸入測試:
輸入 實際 prompt_tokens TTFT 生成速度 16K 16405 14.54s 82.48 tok/s 32K 32789 15.43s 76.54 tok/s 64K 65557 33.29s 61.35 tok/s
最終整合結果(2026-08-25 第二十七次)短基準:75.74 tok/s、TTFT 0.63s(落在 72~77 正常區間,穩定健康)
大輸入測試(各 3 輪):
輸入 prompt_tokens 平均 TTFT 平均生成速度 每輪 TTFT 16K 16405 14.84s 86.27 tok/s 15.93 / 14.39 / 14.19 32K 32789 29.08s 69.02 tok/s 28.85 / 29.23 / 29.16 64K 65557 62.39s 54.56 tok/s 62.20 / 62.64 / 62.34 解讀:
-
TTFT(首字延遲)近乎線性翻倍:16K 14.8s → 32K 29.1s(×1.96)→ 64K 62.4s(×2.14)。64K 要等約 1 分鐘才出首字,這是 prefill 的物理成本。
-
生成速度隨 context 變大而下降:16K 86.3 → 32K 69.0 → 64K 54.6 tok/s(KV cache 越大 attention 計算越重)。
-
單卡Qwen3.8-27B-UD-Q5_K_XL.gguf 裝不下!!
你这是真快啊。。。
- **是 llama.cpp 底層又默默變強了。雙卡玩家記得一定要對稱等分(1:1)、注意 PCIe 頻寬、且多模態上下文能開大就開大,才能跑得穩又跑得快!
-
-
@ydm llama.cpp你是用日更版,还是0.3.0正式版
-
@ydm llama.cpp你是用日更版,还是0.3.0正式版
@ydm llama.cpp你是用日更版,还是0.3.0正式版
使用日更版本的:llama-b10635-bin-win-cuda-13.3-x64
我沒有每日更新版本,因為有時後會變差,所以我用HERMES天天幫我看幫我分析,是否要更新測試:Hermes [機器人]19:32
【llama.cpp 有新 build】
舊版本:b10647 → 新版本:b10666(2026-08-28)
https://github.com/ggml-org/llama.cpp/releases/tag/b10666
中間 19 筆 commit 重點:- 模型:簡化 MiniMax-01 的計算圖 (#27790)
- 投機解碼:新增僅供 benchmark 使用的合成 speculative acceptance 選項 (#27711)
- UI:將「每對話 MCP 覆寫」改為「每對話 tool policy」(#27745)
- 轉檔:修復 Nemotron-H LoRA 的 GGUF 轉換問題 (#27356)
- UI:改善 Chat Form Actions 的 UI/UX(模型選擇器、新增面板)(#27746)
- llama:model_loader 新增 TENSOR_READ_LAZY(延遲讀取張量)(#27794)
- 開發工具:pr2wt 依 base 選擇 ssh/https remote 建立 worktree (#27800)
- 功能:Vulkan 後端新增 Deepseek V4 運算的 LIGHTNING_INDEXER 支援 (#27453)
- 量化:限制 quantize 工作記憶體上限,避免大張量被載入 RAM (#27795)
- OpenCL:新增 MoE 二進位運算 kernel(q4_0/q8_1、mxfp4/q8_1 dp4a bin)(#27768)
- 投機解碼:新增 DFlash2 支援(local convolution + candidate selector)(#27342) (#27816)
- CI:Windows ROCm 發行版隨附 HIP runtime DLL (#26973)
- 模型:新增 Qwen3.8-Flash-Next (qwen4exp) 支援 (#27742)
- CI:windows-rocm 發行版只編譯 ggml-hip 後端 (#27753)
- server:新增 ctx-per-slot 參數(--kv-unified-per-slot)(#24124)
- Hexagon:修復 RMS_NORM_MUL 在 grouped/broadcast norm 的 weight-offset bug (#27798)
- ggml-hexagon:HTP 新增 ABS 與 LOG 單元運算 (#27786)
- 模型:Nemotron3.5 新增 DSpark 支援 (#27804)
- 測試:test-save-load-state 擴充至所有架構 (#27755)
更新建議:
️ 不急更新- 相關:#27742 新增 Qwen3.8-Flash-Next 模型支援(Qwen 家族新功能,非現有 27B 的修復);#24124 server 新增 --kv-unified-per-slot(多 slot 場景才用得上)
- 無關:Vulkan/OpenCL/Hexagon/ROCm、UI、CI、Nemotron/MiniMax/Deepseek 模型支援等
- 結論:本次沒有 CUDA 或 Qwen 27B 的 bug fix/效能提升,現有環境不受影響;若想試 Qwen3.8-Flash-Next 新模型再考慮更新。
-
@ydm 谢谢你的分享,我昨天也安装完成,但还没有调试,目前直接run后,输出,25token 左右,后续调试好后我也分享一下
-
,J johnnybegood 引用了 此主题
