@marsempire Github已經更新到0.4.1,應該你提到的東西都改好囉
-
給新手小白的LLama.ccp快速啟動器 -
給新手小白的LLama.ccp快速啟動器@marsempire gpu_split是因為我是個用兩張不同型號顯卡一起跑的怪咖,我現在是5070TI+3070TI,不用這種參數沒辦法把顯存逼到極限啦....
剩下的問題我晚點再改吧
剛剛更新了效能分析的功能,有點燃燒殆盡了... -
給新手小白的LLama.ccp快速啟動器@marsempire Github已更新,再麻煩重新下載安裝看看是不是還有切視窗的問題喔
-
給新手小白的LLama.ccp快速啟動器@marsempire 我自己的沒有這個問題,想確定一下你的螢幕解析度還有是否有使用桌面放大功能呢?
參數部分都要到all model那邊才會保存,主介面的回存功能我有空會更新 -
假如我自己组建Qwen3.8 27b 服务器, 160 tps@Quanta-Magic 我覺得你問錯地方了,這邊都是愛折騰的,你問10個可能9個已經有本地的Qwen3.8了,哈哈哈。
-
DeepSeek-V4-Flash-Vision-Exp 开源了,现在有跑本地的量化版本吗@csmkaka 相見恨晚阿,我趕快去搞一個
-
給新手小白的LLama.ccp快速啟動器@terry 有想到什麼需求也可以跟我說一下,我看看有沒有力氣改
這些功能都是我自己想到的 -
給新手小白的LLama.ccp快速啟動器@royleecn 更新了喔,還新增了不少功能唷
-
給新手小白的LLama.ccp快速啟動器9/4 更新版本 0.4.1
更新效能圖表工具,適應不同解析度,更多的細節參數設定等等8/31更新新版本
增加了LOG讀取來做速度分析的功能及設定思考等級的功能喔~
請有需要的各位多多取用
常常下載了新的模型卻不會寫啟動參數嗎?
俺也一樣!
所以就讓AI與我合力做了這款llama-launcher
https://github.com/pttocean-afk/llama-launcher支援快速設定、高速啟動、即時LOG、遠端啟動等功能
希望能回饋版上的各位如果有任何想要改善的部分也歡迎跟我說


-
原有一张3090,可以搭配一张2080ti 22g吗?玩qwen3.8 27b q4km@fafafa 不過20系列對有些編碼的支援度不太好喔,看你要不要找30系列的,他們會便宜不是沒道理。
-
原有一张3090,可以搭配一张2080ti 22g吗?玩qwen3.8 27b q4km@fafafa 你可以去看一下我異構卡的那篇,基本上不會掉到2080TI的速度啦...
-
主要玩comfyui跑minimax-h3,想把手上的7900XTX换成R9700可行吗?顯存不太夠-->換更大顯存-->很像可以跑更好的模型-->顯存不太夠
無~限~循~環~ -
5070TI+3070TI異構雙卡跑Qwen3.8數據及優化請益@terry 不好意思看了你的影片才來加入論壇找解決方案,沒注意到是AI。
這邊附上圖,這大概是20K上下文左右的速度,約30T/S左右

如果馬上換成Qwen3.6-35B-A3B-UD-IQ4NL的話,約100T/S左右

-
5070TI+3070TI異構雙卡跑Qwen3.8數據及優化請益@Xiaote 感謝大神回復
如此看來只有升級硬體一途了,當初轉手玩ai手上都是遊戲硬體,看來能做出這樣的結果已經很不錯,有時間會測試-fa參數再來報告。
MTP已經有試過了,上下文會大幅縮小,而且提升非常有限,並不划算。
我的主機板是X570,3070TI跑起來是Pcie4.0x8,目前可能是因為非對稱卡的關係P2P暫且是搞不起來,也許這個也是影響速度的一大因素啦.. -
主要玩comfyui跑minimax-h3,想把手上的7900XTX换成R9700可行吗?小弟淺見
沒意外會變慢,但是可以跑的解析度跟時間長度會更好,各有優劣。 -
5070TI+3070TI異構雙卡跑Qwen3.8數據及優化請益最近看到 LCZ 上有雙 RTX 5070 Ti 跑 Qwen3.8-27B 的分享,對方使用 tensor split + MTP,在特定條件下可達 50–75 tok/s。這裡整理自己的非對稱雙卡實測,想請教有經驗的玩家:在 5070 Ti + 3070 Ti 上,是否有更適合的 split mode、CUDA 參數或其他穩定優化方向?
一、硬體與軟體
- GPU 0:RTX 5070 Ti 16GB
- GPU 1:RTX 3070 Ti 8GB
- 系統:Windows 原生 llama.cpp
- llama.cpp runtime:b10509
- GPU split:
16,8 - split mode:
layer - main GPU:GPU 0
--parallel 1- MTP:關閉
- Vision/mmproj:本篇主測試關閉
- 電腦平時仍有 Windows 桌面常駐程式,因此 GPU 0 不會完全零占用;GPU 1盡量保持乾淨
兩張卡不是同型號,VRAM、記憶體頻寬與運算能力都不同,因此沒有照搬雙5070 Ti的
tensor-split 1,1。二、Qwen3.8-27B IQ4_NL:Vulkan 224K Thinking-On 真實Coding Agent
啟動條件
Model: Qwen3.8-27B-IQ4_NL.gguf Runtime: Windows b10509 Vulkan Context: 229,376 tokens(224K) Split: layer / 16,8 KV: IQ4_NL K/V Thinking: On Vision: Off MTP: Off Parallel slots: 1這不是固定短prompt benchmark,而是實際 DSH coding-agent 工作流,共117筆已完成樣本,包含工具操作與上下文逐步累積。
Decode 曲線
實際使用Context 樣本數 Decode中位數 0–16K 4 31.53 t/s 16–32K 2 30.41 t/s 32–64K 3 26.27 t/s 64–96K 12 23.23 t/s 96–128K 26 22.30 t/s 128–160K 62 19.72 t/s 160–192K 5 17.74 t/s 192–224K 3 16.87 t/s 穩定性
- 最高完成Context:210,515 tokens(205.58K)
- 最低健康Decode:16.71 t/s
- Pipeline fallback:0
- Vulkan OOM:0
- Decode failure:0
- llama.cpp truncation:0
DSH在約204.8K壓力門檻先做tool-result pruning,實際曾將server可見Context從210,515降到137,108;壓縮後下一輪Decode從16.87恢復到20.18 t/s。這次長Context工作全程可以正常完成。
三、同一模型改用Windows CUDA
Q4_0 KV結果
Model: Qwen3.8-27B-IQ4_NL.gguf Runtime: Windows b10509 CUDA Split: layer / 16,8 KV: Q4_0 K/V Thinking: Off(速度邊界測試) MTP: OffMax Context 啟動/請求 8K附近暖機Decode 128K 正常 37.83 t/s 160K 正常 38.49 t/s 192K 正常,最高確認 38.51 t/s 224K CUDA1 compute-buffer OOM — 256K CUDA1 compute-buffer OOM — 192K、Q4_0 KV的原始Decode曲線:
1K 38.31 t/s 8K 36.84 t/s 16K 35.14 t/s 32K 32.37 t/s 65K 27.81 t/s 98K 24.32 t/s 131K 21.69 t/s 164K 19.55 t/sCUDA + IQ4_NL KV
同一模型在CUDA改用IQ4_NL K/V可以載入,但實際進入病態慢速路徑:
- 8K左右Decode約3.66 t/s
- Prompt processing也會隨長度明顯下滑
- 沒有看到熱降頻,較像CUDA backend/kernel路徑問題
因此目前實用分工是:
Vulkan:IQ4_NL KV CUDA:Q4_0 KV四、另一顆Qwen3.6 35B-A3B MoE對照
本機另有:
Qwen3.6-35B-A3B-UD-IQ4_NL它是MoE,不是Dense,GGUF約16.8 GiB;Qwen3.8-27B IQ4_NL約15.2 GiB。雖然MoE權重檔較大,但它的KV架構較省,且每token只啟用部分expert。
Windows CUDA、Q4 KV、262K設定下,曾做過真實BunnyGO工作流曲線:
使用Context Decode中位數 0–10K 118.27 t/s 10–30K 111.22 t/s 30–60K 93.85 t/s 60–90K 80.96 t/s 90–120K 70.07 t/s 120–150K 59.11 t/s 150–180K 51.19 t/s 180–200K 48.46 t/s 這顆目前比較適合高速文書、Wiki審查與大量Agent任務;Qwen3.8則保留給coding、複雜推理和重要review。
五、目前採用的方案
Qwen3.8-27B IQ4_NL → Coding主力 → Vulkan / 224K / IQ4_NL KV / Thinking On / layer 16,8 Qwen3.6-35B-A3B UD-IQ4_NL → 高速任務主力 → CUDA / Q4 KV / 可到262K / layer 16,8六、想請教的問題
- 在 RTX 5070 Ti 16GB + RTX 3070 Ti 8GB 這種非對稱雙卡上,
split-mode tensor是否值得嘗試?還是layer + 16,8通常更適合? - 如果改用tensor split,是否有建議的比例?不確定
1,1在非對稱卡上會不會讓3070 Ti成為瓶頸。 - Qwen3.8-27B IQ4_NL在CUDA上使用IQ4_NL KV會固定進入慢速路徑,是否有人在較新的llama.cpp版本、CUDA版本或特定參數下成功改善?
- 對長Context coding agent來說,MTP在雙卡非對稱配置下是否真的值得?目前觀察到MTP會增加VRAM與配置複雜度,因此暫時關閉。
- 有沒有適合這種非對稱雙卡、要求單slot長Context與穩定性的llama.cpp參數建議?