跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 AI 广场
MK CHAOM

MK CHAO

@MK CHAO
德高望重
取消关注 关注
关于
帖子
16
主题
2
分享
0
群组
1
粉丝
0
关注
0

帖子

最新 最佳 有争议的

  • 給新手小白的LLama.ccp快速啟動器
    MK CHAOM MK CHAO

    @marsempire Github已經更新到0.4.1,應該你提到的東西都改好囉

    LLM讨论区 llama.cpp

  • 給新手小白的LLama.ccp快速啟動器
    MK CHAOM MK CHAO

    @marsempire gpu_split是因為我是個用兩張不同型號顯卡一起跑的怪咖,我現在是5070TI+3070TI,不用這種參數沒辦法把顯存逼到極限啦....
    剩下的問題我晚點再改吧
    剛剛更新了效能分析的功能,有點燃燒殆盡了...

    LLM讨论区 llama.cpp

  • 給新手小白的LLama.ccp快速啟動器
    MK CHAOM MK CHAO

    @marsempire Github已更新,再麻煩重新下載安裝看看是不是還有切視窗的問題喔

    LLM讨论区 llama.cpp

  • 給新手小白的LLama.ccp快速啟動器
    MK CHAOM MK CHAO

    @marsempire 我自己的沒有這個問題,想確定一下你的螢幕解析度還有是否有使用桌面放大功能呢?
    參數部分都要到all model那邊才會保存,主介面的回存功能我有空會更新

    LLM讨论区 llama.cpp

  • 假如我自己组建Qwen3.8 27b 服务器, 160 tps
    MK CHAOM MK CHAO

    @Quanta-Magic 我覺得你問錯地方了,這邊都是愛折騰的,你問10個可能9個已經有本地的Qwen3.8了,哈哈哈。

    LLM讨论区 qwen-27b 服务器

  • DeepSeek-V4-Flash-Vision-Exp 开源了,现在有跑本地的量化版本吗
    MK CHAOM MK CHAO

    @csmkaka 相見恨晚阿,我趕快去搞一個

    LLM讨论区 deepseek 量化

  • 給新手小白的LLama.ccp快速啟動器
    MK CHAOM MK CHAO

    @terry 有想到什麼需求也可以跟我說一下,我看看有沒有力氣改
    這些功能都是我自己想到的

    LLM讨论区 llama.cpp

  • 給新手小白的LLama.ccp快速啟動器
    MK CHAOM MK CHAO

    @royleecn 更新了喔,還新增了不少功能唷

    LLM讨论区 llama.cpp

  • 給新手小白的LLama.ccp快速啟動器
    MK CHAOM MK CHAO

    9/4 更新版本 0.4.1
    更新效能圖表工具,適應不同解析度,更多的細節參數設定等等

    8/31更新新版本

    增加了LOG讀取來做速度分析的功能及設定思考等級的功能喔~

    請有需要的各位多多取用

    常常下載了新的模型卻不會寫啟動參數嗎?

    俺也一樣!

    所以就讓AI與我合力做了這款llama-launcher
    https://github.com/pttocean-afk/llama-launcher

    支援快速設定、高速啟動、即時LOG、遠端啟動等功能
    希望能回饋版上的各位

    如果有任何想要改善的部分也歡迎跟我說

    主畫面.png

    遠端啟動介面.png

    LLM讨论区 llama.cpp

  • 原有一张3090,可以搭配一张2080ti 22g吗?玩qwen3.8 27b q4km
    MK CHAOM MK CHAO

    @fafafa 不過20系列對有些編碼的支援度不太好喔,看你要不要找30系列的,他們會便宜不是沒道理。

    AI硬件 rtx3090 rtx2080ti qwen-27b

  • 原有一张3090,可以搭配一张2080ti 22g吗?玩qwen3.8 27b q4km
    MK CHAOM MK CHAO

    @fafafa 你可以去看一下我異構卡的那篇,基本上不會掉到2080TI的速度啦...

    AI硬件 rtx3090 rtx2080ti qwen-27b

  • 主要玩comfyui跑minimax-h3,想把手上的7900XTX换成R9700可行吗?
    MK CHAOM MK CHAO

    顯存不太夠-->換更大顯存-->很像可以跑更好的模型-->顯存不太夠
    無~限~循~環~

    AI硬件 7900xtx r9700 comfyui

  • 5070TI+3070TI異構雙卡跑Qwen3.8數據及優化請益
    MK CHAOM MK CHAO

    @terry 不好意思看了你的影片才來加入論壇找解決方案,沒注意到是AI。

    這邊附上圖,這大概是20K上下文左右的速度,約30T/S左右
    83128f7e-761d-47c7-a1a8-0ab3e6698638-image.jpeg

    如果馬上換成Qwen3.6-35B-A3B-UD-IQ4NL的話,約100T/S左右
    2f18a779-5283-44ec-8e03-3e06c8c77189-image.jpeg

    LLM讨论区 rtx3070ti 多卡部署 qwen

  • 5070TI+3070TI異構雙卡跑Qwen3.8數據及優化請益
    MK CHAOM MK CHAO

    @Xiaote 感謝大神回復
    如此看來只有升級硬體一途了,當初轉手玩ai手上都是遊戲硬體,看來能做出這樣的結果已經很不錯,有時間會測試-fa參數再來報告。
    MTP已經有試過了,上下文會大幅縮小,而且提升非常有限,並不划算。
    我的主機板是X570,3070TI跑起來是Pcie4.0x8,目前可能是因為非對稱卡的關係P2P暫且是搞不起來,也許這個也是影響速度的一大因素啦..

    LLM讨论区 rtx3070ti 多卡部署 qwen

  • 主要玩comfyui跑minimax-h3,想把手上的7900XTX换成R9700可行吗?
    MK CHAOM MK CHAO

    小弟淺見
    沒意外會變慢,但是可以跑的解析度跟時間長度會更好,各有優劣。

    AI硬件 7900xtx r9700 comfyui

  • 5070TI+3070TI異構雙卡跑Qwen3.8數據及優化請益
    MK CHAOM MK CHAO

    最近看到 LCZ 上有雙 RTX 5070 Ti 跑 Qwen3.8-27B 的分享,對方使用 tensor split + MTP,在特定條件下可達 50–75 tok/s。這裡整理自己的非對稱雙卡實測,想請教有經驗的玩家:在 5070 Ti + 3070 Ti 上,是否有更適合的 split mode、CUDA 參數或其他穩定優化方向?

    一、硬體與軟體

    • GPU 0:RTX 5070 Ti 16GB
    • GPU 1:RTX 3070 Ti 8GB
    • 系統:Windows 原生 llama.cpp
    • llama.cpp runtime:b10509
    • GPU split:16,8
    • split mode:layer
    • main GPU:GPU 0
    • --parallel 1
    • MTP:關閉
    • Vision/mmproj:本篇主測試關閉
    • 電腦平時仍有 Windows 桌面常駐程式,因此 GPU 0 不會完全零占用;GPU 1盡量保持乾淨

    兩張卡不是同型號,VRAM、記憶體頻寬與運算能力都不同,因此沒有照搬雙5070 Ti的tensor-split 1,1。

    二、Qwen3.8-27B IQ4_NL:Vulkan 224K Thinking-On 真實Coding Agent

    啟動條件

    Model: Qwen3.8-27B-IQ4_NL.gguf
    Runtime: Windows b10509 Vulkan
    Context: 229,376 tokens(224K)
    Split: layer / 16,8
    KV: IQ4_NL K/V
    Thinking: On
    Vision: Off
    MTP: Off
    Parallel slots: 1
    

    這不是固定短prompt benchmark,而是實際 DSH coding-agent 工作流,共117筆已完成樣本,包含工具操作與上下文逐步累積。

    Decode 曲線

    實際使用Context 樣本數 Decode中位數
    0–16K 4 31.53 t/s
    16–32K 2 30.41 t/s
    32–64K 3 26.27 t/s
    64–96K 12 23.23 t/s
    96–128K 26 22.30 t/s
    128–160K 62 19.72 t/s
    160–192K 5 17.74 t/s
    192–224K 3 16.87 t/s

    穩定性

    • 最高完成Context:210,515 tokens(205.58K)
    • 最低健康Decode:16.71 t/s
    • Pipeline fallback:0
    • Vulkan OOM:0
    • Decode failure:0
    • llama.cpp truncation:0

    DSH在約204.8K壓力門檻先做tool-result pruning,實際曾將server可見Context從210,515降到137,108;壓縮後下一輪Decode從16.87恢復到20.18 t/s。這次長Context工作全程可以正常完成。

    三、同一模型改用Windows CUDA

    Q4_0 KV結果

    Model: Qwen3.8-27B-IQ4_NL.gguf
    Runtime: Windows b10509 CUDA
    Split: layer / 16,8
    KV: Q4_0 K/V
    Thinking: Off(速度邊界測試)
    MTP: Off
    
    Max Context 啟動/請求 8K附近暖機Decode
    128K 正常 37.83 t/s
    160K 正常 38.49 t/s
    192K 正常,最高確認 38.51 t/s
    224K CUDA1 compute-buffer OOM —
    256K CUDA1 compute-buffer OOM —

    192K、Q4_0 KV的原始Decode曲線:

    1K   38.31 t/s
    8K   36.84 t/s
    16K  35.14 t/s
    32K  32.37 t/s
    65K  27.81 t/s
    98K  24.32 t/s
    131K 21.69 t/s
    164K 19.55 t/s
    

    CUDA + IQ4_NL KV

    同一模型在CUDA改用IQ4_NL K/V可以載入,但實際進入病態慢速路徑:

    • 8K左右Decode約3.66 t/s
    • Prompt processing也會隨長度明顯下滑
    • 沒有看到熱降頻,較像CUDA backend/kernel路徑問題

    因此目前實用分工是:

    Vulkan:IQ4_NL KV
    CUDA:Q4_0 KV
    

    四、另一顆Qwen3.6 35B-A3B MoE對照

    本機另有:

    Qwen3.6-35B-A3B-UD-IQ4_NL
    

    它是MoE,不是Dense,GGUF約16.8 GiB;Qwen3.8-27B IQ4_NL約15.2 GiB。雖然MoE權重檔較大,但它的KV架構較省,且每token只啟用部分expert。

    Windows CUDA、Q4 KV、262K設定下,曾做過真實BunnyGO工作流曲線:

    使用Context Decode中位數
    0–10K 118.27 t/s
    10–30K 111.22 t/s
    30–60K 93.85 t/s
    60–90K 80.96 t/s
    90–120K 70.07 t/s
    120–150K 59.11 t/s
    150–180K 51.19 t/s
    180–200K 48.46 t/s

    這顆目前比較適合高速文書、Wiki審查與大量Agent任務;Qwen3.8則保留給coding、複雜推理和重要review。

    五、目前採用的方案

    Qwen3.8-27B IQ4_NL
    → Coding主力
    → Vulkan / 224K / IQ4_NL KV / Thinking On / layer 16,8
    
    Qwen3.6-35B-A3B UD-IQ4_NL
    → 高速任務主力
    → CUDA / Q4 KV / 可到262K / layer 16,8
    

    六、想請教的問題

    1. 在 RTX 5070 Ti 16GB + RTX 3070 Ti 8GB 這種非對稱雙卡上,split-mode tensor是否值得嘗試?還是layer + 16,8通常更適合?
    2. 如果改用tensor split,是否有建議的比例?不確定1,1在非對稱卡上會不會讓3070 Ti成為瓶頸。
    3. Qwen3.8-27B IQ4_NL在CUDA上使用IQ4_NL KV會固定進入慢速路徑,是否有人在較新的llama.cpp版本、CUDA版本或特定參數下成功改善?
    4. 對長Context coding agent來說,MTP在雙卡非對稱配置下是否真的值得?目前觀察到MTP會增加VRAM與配置複雜度,因此暫時關閉。
    5. 有沒有適合這種非對稱雙卡、要求單slot長Context與穩定性的llama.cpp參數建議?
    LLM讨论区 rtx3070ti 多卡部署 qwen
  • 登录

  • 登录或注册以进行搜索。
  • 第一个帖子
    最后一个帖子
0
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组