小弟是個MIS,但因為工作環境其實很久沒有接觸新知,AI火了很多年,直到今年因為體驗過gemini雲端ai感受到AI的強大,後來開始一系列的上網看影片補知識,搭建了第一個agent應用,用hermes做我的生活助理,更是不斷讓我驚奇,之後看到老特說/掄搥者頻道又學到了很多名詞,還有一些本地AI的觀念,目前雖然調整參數什麼的還是不會,但至少有建立起非常基礎的知識了。
前面廢話完畢,總之看了老特大神的影片,又來到論壇每天潛水,終於慢慢開始計畫弄自己的AI工作站。首先我先在FB market找到一家動畫工作室,搬走這台又大又重的退役X99工作站
- CPU:i7-6850K (水冷一體是散熱器)
- RAM:DDR4-2666 8G*2
- MB:技嘉 GA-X99-ULTRA GAMING
- POWER:EVGA 1000 G3 80 GOLD PLUS
- SSD:自備samsung pm981a 1TB
我另外上淘寶買了下面零件
- E5-2680v4
- DDR4-2400 RDIMM 32G*4
- RTX 2080Ti 22G *2 (雙散熱器風扇,佔2.5slot),加上NVLINK 2.0組合
這幾天終於利用下班時間慢慢升級這台洋垃圾成完全體,也一面跟gemini和hermes討論除錯,總算裝好ubuntu 24.04系統和配好環境。
啟動腳本
#!/bin/bash
# llama-server - Qwen3.6-27B MTP-Q5_K_P (雙卡 NVLink)
# 啟動:~/serve-qwen-mtp.sh
# 停止:~/serve-stop.sh
PID_FILE="/tmp/llama-server.pid"
LOG_FILE="/tmp/llama-server.log"
# 如果已經在跑,先關掉
if [ -f "$PID_FILE" ]; then
OLD_PID=$(cat "$PID_FILE")
if kill -0 "$OLD_PID" 2>/dev/null; then
echo "🔴 停止舊服務 (PID $OLD_PID)..."
kill "$OLD_PID"
sleep 2
if kill -0 "$OLD_PID" 2>/dev/null; then
kill -9 "$OLD_PID"
sleep 1
fi
fi
rm -f "$PID_FILE"
fi
# 鎖 200W 功耗
nvidia-smi -pl 200 > /dev/null 2>&1
echo "🟢 啟動 Qwen3.6-27B MTP-Q5_K_P..."
nohup /home/user/llama.cpp.cuda/build/bin/llama-server \
--alias qwen3.6 \
--host 0.0.0.0 \
--port 8080 \
--model /home/user/models/Qwen3.6-27B-Uncensored-HauhauCS-Balanced-MTP-Q5_K_P.gguf \
--mmproj /home/user/models/mmproj-Qwen3.6-27B-HauhauCS-Balanced-f16.gguf \
-ngl 99 \
-c 131072 \
--cache-type-k q4_0 \
--cache-type-v q4_0 \
--spec-type draft-mtp \
--spec-draft-n-max 2 \
--reasoning off \
-fa 1 \
-ub 512 \
-np 1 \
-fit off \
--image-min-tokens 1024 \
> "$LOG_FILE" 2>&1 &
NEW_PID=$!
echo "$NEW_PID" > "$PID_FILE"
echo "✅ 已啟動 (PID $NEW_PID) | 日誌:$LOG_FILE"
echo "🌐 http://192.168.10.6:8080"
nvidia-smi畫面,這是沒有任務時的狀態,覆載時大概會衝到50/60度c,有手動設定限制功耗上限200瓦,省點電和降低發熱,兩張卡貼的實在太近了,怕~

編譯了最新的llama.cpp,雙卡文字推理生成速度

編譯腳本供參
#!/bin/bash
# llama.cpp CUDA 版更新腳本
# 用法:~/llama-cuda-update.sh
set -e
LLAMA_DIR="$HOME/llama.cpp.cuda"
BUILD_DIR="$LLAMA_DIR/build"
CORES=$(nproc)
echo "🔄 更新 llama.cpp ..."
# 1. 先停止現有服務
if [ -f /tmp/llama-server.pid ]; then
OLD_PID=$(cat /tmp/llama-server.pid)
if kill -0 "$OLD_PID" 2>/dev/null; then
echo "🔴 停止現有服務 (PID $OLD_PID)..."
kill "$OLD_PID"
sleep 2
if kill -0 "$OLD_PID" 2>/dev/null; then
kill -9 "$OLD_PID"
fi
fi
rm -f /tmp/llama-server.pid
fi
# 2. 拉最新原始碼
cd "$LLAMA_DIR"
echo "📥 git pull..."
git pull --ff-only
# 3. 重新 cmake 設定 + 編譯(CUDA 加速)
echo "🔧 cmake 設定..."
cd "$LLAMA_DIR"
cmake -B build -DGGML_CUDA=ON
echo "🔧 編譯中(使用 $CORES 線程)..."
cmake --build build --config Release -j "$CORES"
# 4. 驗證
echo "✅ 編譯完成!"
ls -lh "$BUILD_DIR/bin/llama-server"
echo "---"
echo "🟢 請執行以下指令重啟服務:"
echo " ~/llama-cuda-qwen3.6-Q5-mtp.sh"
以上是粗淺的心得,速度沒有單一張7900XTX猛暴,但這老卡勝在便宜,疊兩張得到44GB VRAM,AI都給我信心加持說這已將很划算,性能表現也很正常
。我不知道的東西還是太多了,大部分都是問AI然後貼上,或是AI幫我改,煩請各位大神不吝賜教,謝謝。



,也太佩服站長,太有才了,論壇居然還可以接入ai
