男人們的大玩具 欣賞一下美國網友的 Homelab
-
男人們的大玩具 欣賞一下美國網友的 Homelab

Source: Reddit大玩具 Part 1 > 帖主的大玩具




大玩具 Part 2 : 底下網友可愛的回覆

4× PNY RTX PRO 6000 Blackwell 96GB 600W + 4× HP RTX PRO 6000 Blackwell Max-Q 96GB 300W

-
-
基本上 家家戶戶 都至少要有兩張 RTX Pro 6000 MaxQ at $300 each.

AI 的價值不應該如此昂貴 , We need freedom of AI and Pro 6000. -
-
-
-
謝謝您的陪伴 我也是小16G x 2

你要不要多一張 7900 XTX 24GB ?不錯用說 考慮一下暫時沒有要加硬體,現在雙卡 跑LLM 還不錯,玩HERMES夠用就好~~
LLama.cpp 更新 b10786 把 mmproj 放 cuda 1 VRAM 平均 跑起來還可以,試幾天看看會不會oom ,不會再拉高ctx,大該有70~75 t/s
llama-server.exe ^
-m "models\Qwen3.8-27B-UD-Q5_K_XL.gguf" ^
--mmproj "models\mmproj-Qwen3.8-27B-f16.gguf" ^
--mmproj-device CUDA1 ^
--image-min-tokens 1024 ^
--image-max-tokens 2048 ^
--split-mode tensor ^
--tensor-split 1,1 ^
--main-gpu 0 ^
-ngl 999 ^
-t 8 ^
-fa on ^
--ctx-size 131072 ^
--parallel 1 ^
-b 4096 ^
-ub 1024 ^
-cb ^
--cache-type-k q8_0 ^
--cache-type-v q8_0 ^
--spec-type draft-mtp ^
--spec-draft-ngl 999 ^
--spec-draft-n-max 2 ^
--spec-draft-p-min 0 ^
--jinja ^
--chat-template-file "models\chat_template.jinja" ^
--reasoning-format deepseek ^
--reasoning-preserve ^
--chat-template-kwargs "{"reasoning_effort":"medium"}" ^
--temp 0.2 ^
--min-p 0.05 ^
--samplers "min_p;temperature" ^
--repeat-penalty 1.05 ^
--host 0.0.0.0 ^
--port 8080 -
謝謝您的陪伴 我也是小16G x 2

你要不要多一張 7900 XTX 24GB ?不錯用說 考慮一下暫時沒有要加硬體,現在雙卡 跑LLM 還不錯,玩HERMES夠用就好~~
LLama.cpp 更新 b10786 把 mmproj 放 cuda 1 VRAM 平均 跑起來還可以,試幾天看看會不會oom ,不會再拉高ctx,大該有70~75 t/s
llama-server.exe ^
-m "models\Qwen3.8-27B-UD-Q5_K_XL.gguf" ^
--mmproj "models\mmproj-Qwen3.8-27B-f16.gguf" ^
--mmproj-device CUDA1 ^
--image-min-tokens 1024 ^
--image-max-tokens 2048 ^
--split-mode tensor ^
--tensor-split 1,1 ^
--main-gpu 0 ^
-ngl 999 ^
-t 8 ^
-fa on ^
--ctx-size 131072 ^
--parallel 1 ^
-b 4096 ^
-ub 1024 ^
-cb ^
--cache-type-k q8_0 ^
--cache-type-v q8_0 ^
--spec-type draft-mtp ^
--spec-draft-ngl 999 ^
--spec-draft-n-max 2 ^
--spec-draft-p-min 0 ^
--jinja ^
--chat-template-file "models\chat_template.jinja" ^
--reasoning-format deepseek ^
--reasoning-preserve ^
--chat-template-kwargs "{"reasoning_effort":"medium"}" ^
--temp 0.2 ^
--min-p 0.05 ^
--samplers "min_p;temperature" ^
--repeat-penalty 1.05 ^
--host 0.0.0.0 ^
--port 8080 -
我這禮拜測試 , -ub 512 好像是 PP最佳值, 不過測試對象是 7900 XTX
Dual RTX5070Ti 一般沒什麼問題, SGLang 好像蠻穩的Qwen3.8-27B-UD-Q5_K_XL.ggu 換Q4_K_M 可能TPS會更高, 除非是需要 Coding
--cache-type-k q8_0 ^
--cache-type-v q8_0 ^我都用 Q4 換取更大的 ctx-size

我本來也是用-ub 512 開來試一下,忘記調回了

Q5_K_XL.gguf 我和Q4 跑起來有一些精度的差別,我要精度~~
kv cache 我也試過Q4,Q8,Q8精度也好一點點,所以試了可以,把5070ti 壓到我需要的最大精度、最快速度 !!
地端,寫個腳本,我就有感覺了~~~
SGLang 還沒玩,LLAMA.CPP個人使用最簡單




