交作業~新手初試X99配雙RTX2080ti 22G
-
小弟是個MIS,但因為工作環境其實很久沒有接觸新知,AI火了很多年,直到今年因為體驗過gemini雲端ai感受到AI的強大,後來開始一系列的上網看影片補知識,搭建了第一個agent應用,用hermes做我的生活助理,更是不斷讓我驚奇,之後看到老特說/掄搥者頻道又學到了很多名詞,還有一些本地AI的觀念,目前雖然調整參數什麼的還是不會,但至少有建立起非常基礎的知識了。
前面廢話完畢,總之看了老特大神的影片,又來到論壇每天潛水,終於慢慢開始計畫弄自己的AI工作站。首先我先在FB market找到一家動畫工作室,搬走這台又大又重的退役X99工作站
- CPU:i7-6850K (水冷一體是散熱器)
- RAM:DDR4-2666 8G*2
- MB:技嘉 GA-X99-ULTRA GAMING
- POWER:EVGA 1000 G3 80 GOLD PLUS
- SSD:自備samsung pm981a 1TB
我另外上淘寶買了下面零件
- E5-2680v4
- DDR4-2400 RDIMM 32G*4
- RTX 2080Ti 22G *2 (雙散熱器風扇,佔2.5slot),加上NVLINK 2.0組合
這幾天終於利用下班時間慢慢升級這台洋垃圾成完全體,也一面跟gemini和hermes討論除錯,總算裝好ubuntu 24.04系統和配好環境。
啟動腳本
#!/bin/bash # llama-server - Qwen3.6-27B MTP-Q5_K_P (雙卡 NVLink) # 啟動:~/serve-qwen-mtp.sh # 停止:~/serve-stop.sh PID_FILE="/tmp/llama-server.pid" LOG_FILE="/tmp/llama-server.log" # 如果已經在跑,先關掉 if [ -f "$PID_FILE" ]; then OLD_PID=$(cat "$PID_FILE") if kill -0 "$OLD_PID" 2>/dev/null; then echo "🔴 停止舊服務 (PID $OLD_PID)..." kill "$OLD_PID" sleep 2 if kill -0 "$OLD_PID" 2>/dev/null; then kill -9 "$OLD_PID" sleep 1 fi fi rm -f "$PID_FILE" fi # 鎖 200W 功耗 nvidia-smi -pl 200 > /dev/null 2>&1 echo "🟢 啟動 Qwen3.6-27B MTP-Q5_K_P..." nohup /home/user/llama.cpp.cuda/build/bin/llama-server \ --alias qwen3.6 \ --host 0.0.0.0 \ --port 8080 \ --model /home/user/models/Qwen3.6-27B-Uncensored-HauhauCS-Balanced-MTP-Q5_K_P.gguf \ --mmproj /home/user/models/mmproj-Qwen3.6-27B-HauhauCS-Balanced-f16.gguf \ -ngl 99 \ -c 131072 \ --cache-type-k q4_0 \ --cache-type-v q4_0 \ --spec-type draft-mtp \ --spec-draft-n-max 2 \ --reasoning off \ -fa 1 \ -ub 512 \ -np 1 \ -fit off \ --image-min-tokens 1024 \ > "$LOG_FILE" 2>&1 & NEW_PID=$! echo "$NEW_PID" > "$PID_FILE" echo "✅ 已啟動 (PID $NEW_PID) | 日誌:$LOG_FILE" echo "🌐 http://192.168.10.6:8080"nvidia-smi畫面,這是沒有任務時的狀態,覆載時大概會衝到50/60度c,有手動設定限制功耗上限200瓦,省點電和降低發熱,兩張卡貼的實在太近了,怕~

編譯了最新的llama.cpp,雙卡文字推理生成速度

編譯腳本供參
#!/bin/bash # llama.cpp CUDA 版更新腳本 # 用法:~/llama-cuda-update.sh set -e LLAMA_DIR="$HOME/llama.cpp.cuda" BUILD_DIR="$LLAMA_DIR/build" CORES=$(nproc) echo "🔄 更新 llama.cpp ..." # 1. 先停止現有服務 if [ -f /tmp/llama-server.pid ]; then OLD_PID=$(cat /tmp/llama-server.pid) if kill -0 "$OLD_PID" 2>/dev/null; then echo "🔴 停止現有服務 (PID $OLD_PID)..." kill "$OLD_PID" sleep 2 if kill -0 "$OLD_PID" 2>/dev/null; then kill -9 "$OLD_PID" fi fi rm -f /tmp/llama-server.pid fi # 2. 拉最新原始碼 cd "$LLAMA_DIR" echo "📥 git pull..." git pull --ff-only # 3. 重新 cmake 設定 + 編譯(CUDA 加速) echo "🔧 cmake 設定..." cd "$LLAMA_DIR" cmake -B build -DGGML_CUDA=ON echo "🔧 編譯中(使用 $CORES 線程)..." cmake --build build --config Release -j "$CORES" # 4. 驗證 echo "✅ 編譯完成!" ls -lh "$BUILD_DIR/bin/llama-server" echo "---" echo "🟢 請執行以下指令重啟服務:" echo " ~/llama-cuda-qwen3.6-Q5-mtp.sh"以上是粗淺的心得,速度沒有單一張7900XTX猛暴,但這老卡勝在便宜,疊兩張得到44GB VRAM,AI都給我信心加持說這已將很划算,性能表現也很正常
。我不知道的東西還是太多了,大部分都是問AI然後貼上,或是AI幫我改,煩請各位大神不吝賜教,謝謝。 -
-
昨天又繼續跟我的hermes一起研究(其實都是它的功勞啦)報告如下

雙 RTX 2080 Ti 22GB 跑 Qwen3.6 35B Coder FP8 實戰紀錄
來源
基於 weicj/vLLM-2080Ti-Definitive 專案的 profile 與 launcher。
硬體
- 2× RTX 2080 Ti 22GB + NVLink
- GPU 功耗上限 200W
模型
Jackrong/Qwopus3.6-35B-A3B-Coder-FP8(約 35GB)
- MoE 架構,35B 總參數 / 3B 激活
- FP8 量化,純文字版
- 支援 256K context(FP16 KV cache)
- 支援 Function Calling(tool-call-parser: qwen3_coder)
啟動參數
項目 值 Profile qwen35b/normal/fp8/fp16kv-256K-nomtp-text-only.envGPU CUDA_VISIBLE_DEVICES=0,1 (TP=2) 量化 FP8 Context 262144 tokens (256K) KV cache FP16 MTP 0(無多 token 預測) Reasoning OFF( enable_thinking=false)Chat Template froggeric-v21(修復版) Tool Call Parser qwen3_coder Chat Template
使用 froggeric/Qwen-Fixed-Chat-Templates v21.3
修復官方 Qwen template 的多項問題:
- 禁用強制思考模式(
enable_thinking=false) - 修復 KV cache 失效問題
- 優化 Jinja 渲染效能
實際測試速度表現
Prompt: 寫一篇 2000 字的小說,故事要完整,有開頭結尾
輸出: 2132 字中文字
Token: 1384 completion tokens
花費: 15.14 秒
速度: 91.4 tok/s
結束: stop(自然結束)項目 數據 生成速度(暖機後) 91.4 tok/s TTFT(首個 token) ~11ms 最大小說產出 2132 字 / 1384 tokens / 15.14s 我滿足了

