@linkdesu 我已經用兩台跑很久了,0731出來也已經換上了,真心不錯,速度快,kv緩存也夠500K x 6.
不過coding上使用起來感覺還是差glm 5.2一點,純個人感覺,沒有甚麼根據.
單純論性價比,dsv4f用兩台,glm 5.2至少要四台,dsv4f還是比較高的
-
一直没找到在DGX上能完全满意的一套模型配置 -
一直没找到在DGX上能完全满意的一套模型配置這個模型我有用一陣子, 蠻不錯的, 不過有一些過度思考跟loop輸出的問題, 而且他們好像還在tune, 可能再等一陣子吧.
-
一直没找到在DGX上能完全满意的一套模型配置@包磊 不錯喔,不過如果你之前沒試過,或許可以試試hermes直接接deepseek 看看,可能之前就是模型的問題而已
這兩天DGX論壇上也把單台dgx spark裝deepseek flash 0731搞到看起來還不錯,可以試試. 若一台覺得精度不夠,可能要看用量決定是再買一台來張量並行,還是直接用線上的.
兩台速度快很多,prefill 2000初 t/s, decode 40-60 tok/s, 精度也夠,看怎麼取捨了. -
V100 32G 魔改卡能入手吗?@terry 我看版上很多7900xtx prefill的速度比我的雙卡無nvlink tesla v100還慢,我跑的還是27B Q8, 不知道這個prefill慢的根據是什麼?
再者長文本的prefill應該是緩存沒命中才會造成有感的堵塞,也就是一輪新的會話開始,會等一陣,之後緩存命中的話影響就小,沒命中或緩存flush了就又要等一陣,實際會話中長文本的prefill應該沒那麼常發生,這裡就是看decode的速度了,不是嗎? -
一直没找到在DGX上能完全满意的一套模型配置個人淺見, 如果是複雜冗長的任務, 可能還是用coding agent去跑會比較容易掌握, 可以讓hermes跟coding agent(codex cli/pi agent/claude code/kimi code..等等)協同作戰, 由hermes監控coding agent並由user手動或自動送命令過去.
早期我沒解決會停下來的問題之前, 我是讓openclaw 定期去巡視工作中的tmux sessions, 有誰停下來了, 看起來又還沒完成工作的, 自動送出繼續+enter, 他就會繼續跑了. 也可以讓openclaw/hermes定期或手動讓他回報目前進度跟輸入指令.Deepseek單機我是沒跑過, 我是用雙機跑原版的. 原版權重160G, IQ2SS 應該也差不多80G. 我看論壇上心得是沒有太大損失, kv也足以支撐512K x 3 或 256K x 5. 不過他沒圖像, 剩餘的ram應該也不太夠去架多模態, 如果需要處理圖像可能就無法考慮了.
體感上我覺得deepseek v4 flash比qwen 3.6 27B Q8強一點, 但是差距沒有到很大. qwen 3.6 27B我之所以跑Q8, 是因為這已經是我能接受的速度的極限了, 不然全精度還是放得下的. 後來有出了有含MTP頭的模型我就沒試過BF16了, 或許BF16的qwen 3.6 27B速度有所提升也不一定.
不過, deepseek v4 flash正式版即將推出,或許一切都會讓人改觀.

-
一直没找到在DGX上能完全满意的一套模型配置qwen3.6 27B是有會因為tool call問題而中斷任務的可能, 事實上deepseek也是有toolcall leak 造成coding agent中途停下的問題.
我的解決方法有兩個:- 使用claude code或codex cli的goal工具. 設定了/goal 之後, coding agent會督促模型沒有完成不能停下來. 兩者實現的方式不同, 各有一定效用. 其他如kimi code也是有這個命令,只是我沒用過.
- 我掛了一層proxy上去, 在模型跟code/claude code之間,專門去攔截有問題的訊息,把message修復, 讓整個工作可以繼續下去. 目前我在qwen 3.6 27B, deepseek v4 flash, glm 5.2都有遇到類似但不同的問題, 都是靠proxy修復. 我用的proxy有兩個, 一個是純proxy, https://github.com/ladiossoop5star/opencode_compat_proxy , 一個是因為後來我用litellm做模型的routing, 所以另外做了litellm的hook https://github.com/ladiossoop5star/litellm_coding_agent_hook . 可以參考看看.
-
一直没找到在DGX上能完全满意的一套模型配置如果是一台的話, qwen 3.6 27B Q8或deepseek Q2是合適一點的選擇. 新出的laguna-s 2.1等他穩定一點可能也是一個不錯的選擇.
deepseek單GB10可以參考:
https://forums.developer.nvidia.com/t/1x-spark-tuned-dspark-for-deepseek-v4-flash-35-tok-s-800-prefill-and-fast-multi-agent-serving/376884
https://forums.developer.nvidia.com/t/optimizing-deepseek-v4-flash-on-a-single-nvidia-gb10-gx10-with-dspark-speculative-decoding/376830/22 -
这可能是目前本地部署GLM5.2 的最佳方案了我跑的是這個 https://github.com/ciprianveg/gb10-glm-5.2
不過是用八台, 為了榨出更多的併發數, 我用了DCP4 , prefill跟tok/s都慢不少, 不過得到300K x 10 的ctx

如果是DCP1的話會快上不少, 這是作者的數據:

-
请教洋垃圾4卡v100的128g显卡扩展坞值得吗?看用途吧, 我目前用兩張V100, 64G, 沒有NVLINK, 跑Qwen3.6-27B-Q8_0.gguf , prefill 900 t/s , tok/s 約30. ctx可以到 200K x 3
ComfyUI沒再用, 不過4卡也不會拿來做這個用途 -
8g的HBM矿卡170hx解封了@joker_chang 可以看下這帖: https://lcz.me/post/4642
-
關於能本地運行DeepSeek V4 Flash大模型的配置@terry 目前我兩台GB10跑deepseek V4 flash, 八台跑glm 5.2. 這是我自己兩台GB10跑出來的結果. prefill 速度上面也有, 接近2000 t/s. 每次會話的首字延遲視上下文而定, 約幾秒到分鐘不等. 首字過後緩存命中約9x%, 一般就沒甚麼prefill的花費, 這時候就是看吐字速度了.
-
關於能本地運行DeepSeek V4 Flash大模型的配置@kos-or Deepseek 就很強了, 就我實際使用體感上deepseek v4 flash應該介於minimax M3與Kimi K3之間, 等這兩天deepseek v4正式版出來, 應該會更接近Kimi K3. 如果有chatgpt codex去解決難的問題, 應該就夠用了.
我之所以會有minimax是因為我是按年訂閱的, 退不了... minimax現在新用戶又增加了周限制, 不太划算 -
關於能本地運行DeepSeek V4 Flash大模型的配置@kos-or 很多東西是沒得選擇, 所以也沒有比較的問題. 正常來說除非是持續高強度, 多併發, 整天不間斷地消耗大量token, 不然線上模型是比較划算的.
我個人使用是訂閱了kimi跟minimax搭配使用, 一般用minimax, 難一點用kimi, 愉快使用中. 架那些模型純粹就是工作限制, 不得不的選擇.
-
關於能本地運行DeepSeek V4 Flash大模型的配置@怪物 提供你兩台DGX SPARK GB10跑官方FP4 + FP8 混合的DeepSeek-V4-Flash-DSpark數據參考:
model test t/s peak t/s ttfr (ms) est_ppt (ms) e2e_ttft (ms) deepseek-v4-flash pp2048 1959.48 ± 8.50 1048.24 ± 17.23 930.12 ± 17.23 1048.24 ± 17.23 deepseek-v4-flash tg128 52.03 ± 2.81 62.33 ± 4.03 deepseek-v4-flash pp2048 @ d4096 1991.19 ± 11.48 2952.43 ± 30.38 2834.32 ± 30.38 2952.43 ± 30.38 deepseek-v4-flash tg128 @ d4096 44.09 ± 11.80 54.00 ± 14.45 deepseek-v4-flash pp2048 @ d8192 1951.66 ± 3.01 4816.60 ± 82.26 4698.49 ± 82.26 4816.60 ± 82.26 deepseek-v4-flash tg128 @ d8192 30.62 ± 7.49 38.93 ± 7.88 deepseek-v4-flash pp2048 @ d16384 1959.18 ± 35.62 8516.84 ± 208.01 8398.73 ± 208.01 8516.84 ± 208.01 deepseek-v4-flash tg128 @ d16384 45.72 ± 4.31 38.67 ± 26.89 deepseek-v4-flash pp2048 @ d32768 1948.22 ± 1.68 16207.60 ± 39.41 16089.49 ± 39.41 16207.60 ± 39.41 deepseek-v4-flash tg128 @ d32768 36.85 ± 3.01 47.00 ± 1.41 實際跑coding任務速度大概在45-65之間, 視上下文長度及內容而定, KV快取命中一直處在高檔, 所以速度一般在50~6x t/s之間. 兩台GB10跑起來大約可以有6個500K的任務同時進行, 已經很夠用了.
不過你已經有一張RTX PRO 6000, 預算也差不多可以買另外一張, 兩張應該也是可以跑才是. 只是考慮還要跑comfyui, 可以原本RTX PRO 6000跑comfyui, 兩台GB10叢集跑deepseek v4 flash.
話說回來, 如果是自用的話.. 這些錢用線上的deepseek應該可以用超過十年了...
-
V100 32G 魔改卡能入手吗?@李明 之前貼過兩張V100 32G跑Qwen3.6 27B Q8的測速給你參考:
model test t/s peak t/s ttfr (ms) est_ppt (ms) e2e_ttft (ms) qwen-3.6-27b pp2048 834.28 ± 19.56 2508.84 ± 171.52 2197.12 ± 171.52 2508.84 ± 171.52 qwen-3.6-27b tg128 30.56 ± 0.79 38.67 ± 1.70 qwen-3.6-27b pp2048 @ d4096 937.27 ± 20.09 6170.01 ± 97.33 5858.29 ± 97.33 6170.01 ± 97.33 qwen-3.6-27b tg128 @ d4096 30.53 ± 0.49 38.00 ± 0.82 qwen-3.6-27b pp2048 @ d8192 952.76 ± 8.60 10102.94 ± 101.45 9791.23 ± 101.45 10102.94 ± 101.45 qwen-3.6-27b tg128 @ d8192 30.05 ± 0.74 36.67 ± 1.70 qwen-3.6-27b pp2048 @ d16384 925.11 ± 11.23 18209.55 ± 38.89 17897.84 ± 38.89 18209.55 ± 38.89 qwen-3.6-27b tg128 @ d16384 27.19 ± 1.32 34.33 ± 0.47 qwen-3.6-27b pp2048 @ d32768 854.63 ± 5.92 37259.34 ± 281.61 36947.63 ± 281.61 37259.34 ± 281.61 qwen-3.6-27b tg128 @ d32768 27.10 ± 0.80 35.33 ± 0.94 也有跑orinth-1.0-35b Q8的測試, 他是基於qwen 3.6 35BA3B去微調的, 大概可以100 t/s:
model test t/s peak t/s ttfr (ms) est_ppt (ms) e2e_ttft (ms) ornith-35b pp2048 785.61 ± 15.97 2483.07 ± 66.69 2362.38 ± 66.69 2483.07 ± 66.69 ornith-35b tg128 106.71 ± 4.49 109.00 ± 5.72 ornith-35b pp2048 @ d4096 803.66 ± 14.44 7060.92 ± 293.27 6940.24 ± 293.27 7060.92 ± 293.27 ornith-35b tg128 @ d4096 102.15 ± 1.64 104.00 ± 1.41 ornith-35b pp2048 @ d8192 792.75 ± 2.92 12035.29 ± 105.50 11914.60 ± 105.50 12035.29 ± 105.50 ornith-35b tg128 @ d8192 103.90 ± 0.75 105.33 ± 0.47 ornith-35b pp2048 @ d16384 791.20 ± 7.30 21444.59 ± 125.59 21323.90 ± 125.59 21444.59 ± 125.59 ornith-35b tg128 @ d16384 104.99 ± 4.85 107.33 ± 5.31 ornith-35b pp2048 @ d32768 763.53 ± 9.87 41675.67 ± 664.23 41554.98 ± 664.23 41675.67 ± 664.23 ornith-35b tg128 @ d32768 98.68 ± 0.85 101.00 ± 0.82 GGUF模型都可以跑, 其他的幾乎不用玩了. 現在這個容量之下 , 除了Qwen 3.6 27B / 35BA3B好像也沒其他甚麼模型可以用了.
-
有大神在本地部署 GLM 5.2 吗?@566656661
CRS804是4 port 400G QSFP56-DD, 每個port由八條獨立的資料通道組成, 所以可以分出2x200G, 4x100G等等. 買對線就可以接8台或16台DGX spark. 我看TP 8的時候網路流量好像也沒有到100G, 所以接16台應該對速度也沒有影響. 我是買這條線, 接了8台

-
有大神在本地部署 GLM 5.2 吗?@566656661
2部鏈接在一起的話應該只能接到3台, 兩兩對接. 我是用MikroTik CRS804 switch 接到八台GB10的200G的port. -
有大神在本地部署 GLM 5.2 吗?最近我的DGX SPARK GB10增加到了10台, 其中八台拿來跑GLM5.2, ctx 320K x 10. 正在測試中, 感覺是比deepseek v4 flash強, 強多少要多跑幾天才知道
不過很慢, prefill 大概600-800, tok/s大概2x
ps. 四台就可以跑了, 參考 https://forums.developer.nvidia.com/t/glm-5-2-on-a-4x-gb10-cluster-22-tok-s-decode-256k-ctx-recipe/374125 -
别再推荐免费编程工具Trae了,应该马上收费了,我每天用到被限制了.OpenCode的免費模型我覺的給的額度蠻多的, 每天用來做點雜事還沒用完過, deepseek V4 flash, MiMo V2.5都有
-
为了证明M4 Max真的不行,自己写了案例测试了几个模型剛跑了qwen 3.6 27B Q8 單台DGX spark的測試供參考, 手邊沒有Q4的模型可以跑.

圖片影片的話.. 論壇上有發一篇了, 可以看看