感謝大老,我也成功薅上了gemini pro的羊毛,不過聽說這種玩法違反谷歌政策容易被ban帳,所以還不敢大力使用


交給我的hermes (主大腦 deepseek v4 flash)去整合,生圖(image gen)、視覺(vision)都成功了!

感謝大老,我也成功薅上了gemini pro的羊毛,不過聽說這種玩法違反谷歌政策容易被ban帳,所以還不敢大力使用


交給我的hermes (主大腦 deepseek v4 flash)去整合,生圖(image gen)、視覺(vision)都成功了!

昨天又繼續跟我的hermes一起研究(其實都是它的功勞啦)報告如下
基於 weicj/vLLM-2080Ti-Definitive 專案的 profile 與 launcher。
Jackrong/Qwopus3.6-35B-A3B-Coder-FP8(約 35GB)
| 項目 | 值 |
|---|---|
| Profile | qwen35b/normal/fp8/fp16kv-256K-nomtp-text-only.env |
| GPU | CUDA_VISIBLE_DEVICES=0,1 (TP=2) |
| 量化 | FP8 |
| Context | 262144 tokens (256K) |
| KV cache | FP16 |
| MTP | 0(無多 token 預測) |
| Reasoning | OFF(enable_thinking=false) |
| Chat Template | froggeric-v21(修復版) |
| Tool Call Parser | qwen3_coder |
使用 froggeric/Qwen-Fixed-Chat-Templates v21.3
修復官方 Qwen template 的多項問題:
enable_thinking=false)Prompt: 寫一篇 2000 字的小說,故事要完整,有開頭結尾
輸出: 2132 字中文字
Token: 1384 completion tokens
花費: 15.14 秒
速度: 91.4 tok/s
結束: stop(自然結束)
| 項目 | 數據 |
|---|---|
| 生成速度(暖機後) | 91.4 tok/s |
| TTFT(首個 token) | ~11ms |
| 最大小說產出 | 2132 字 / 1384 tokens / 15.14s |
我滿足了
大佬的ctx開 132072這麼大@@,我的顯卡跟您一樣,照抄參數,跑起來很喘20t/s左右,而且系統內存32G也被佔滿了...
感謝樓上大大,昨天跟hermes搞了一整天,抄完作業,速度提升起來,但還是遠不如該作者的每秒100t,真是夠折騰的了
FP8 文字版 150 tokens 產出:
#1: 3.21s → 46.7 tok/s
#2: 3.12s → 48.1 tok/s
#3: 3.39s → 44.3 tok/s
─────────────────
穩定: ~46 tok/s 
小弟是個MIS,但因為工作環境其實很久沒有接觸新知,AI火了很多年,直到今年因為體驗過gemini雲端ai感受到AI的強大,後來開始一系列的上網看影片補知識,搭建了第一個agent應用,用hermes做我的生活助理,更是不斷讓我驚奇,之後看到老特說/掄搥者頻道又學到了很多名詞,還有一些本地AI的觀念,目前雖然調整參數什麼的還是不會,但至少有建立起非常基礎的知識了。
前面廢話完畢,總之看了老特大神的影片,又來到論壇每天潛水,終於慢慢開始計畫弄自己的AI工作站。首先我先在FB market找到一家動畫工作室,搬走這台又大又重的退役X99工作站
我另外上淘寶買了下面零件
這幾天終於利用下班時間慢慢升級這台洋垃圾成完全體,也一面跟gemini和hermes討論除錯,總算裝好ubuntu 24.04系統和配好環境。
啟動腳本
#!/bin/bash
# llama-server - Qwen3.6-27B MTP-Q5_K_P (雙卡 NVLink)
# 啟動:~/serve-qwen-mtp.sh
# 停止:~/serve-stop.sh
PID_FILE="/tmp/llama-server.pid"
LOG_FILE="/tmp/llama-server.log"
# 如果已經在跑,先關掉
if [ -f "$PID_FILE" ]; then
OLD_PID=$(cat "$PID_FILE")
if kill -0 "$OLD_PID" 2>/dev/null; then
echo "🔴 停止舊服務 (PID $OLD_PID)..."
kill "$OLD_PID"
sleep 2
if kill -0 "$OLD_PID" 2>/dev/null; then
kill -9 "$OLD_PID"
sleep 1
fi
fi
rm -f "$PID_FILE"
fi
# 鎖 200W 功耗
nvidia-smi -pl 200 > /dev/null 2>&1
echo "🟢 啟動 Qwen3.6-27B MTP-Q5_K_P..."
nohup /home/user/llama.cpp.cuda/build/bin/llama-server \
--alias qwen3.6 \
--host 0.0.0.0 \
--port 8080 \
--model /home/user/models/Qwen3.6-27B-Uncensored-HauhauCS-Balanced-MTP-Q5_K_P.gguf \
--mmproj /home/user/models/mmproj-Qwen3.6-27B-HauhauCS-Balanced-f16.gguf \
-ngl 99 \
-c 131072 \
--cache-type-k q4_0 \
--cache-type-v q4_0 \
--spec-type draft-mtp \
--spec-draft-n-max 2 \
--reasoning off \
-fa 1 \
-ub 512 \
-np 1 \
-fit off \
--image-min-tokens 1024 \
> "$LOG_FILE" 2>&1 &
NEW_PID=$!
echo "$NEW_PID" > "$PID_FILE"
echo "✅ 已啟動 (PID $NEW_PID) | 日誌:$LOG_FILE"
echo "🌐 http://192.168.10.6:8080"
nvidia-smi畫面,這是沒有任務時的狀態,覆載時大概會衝到50/60度c,有手動設定限制功耗上限200瓦,省點電和降低發熱,兩張卡貼的實在太近了,怕~

編譯了最新的llama.cpp,雙卡文字推理生成速度

編譯腳本供參
#!/bin/bash
# llama.cpp CUDA 版更新腳本
# 用法:~/llama-cuda-update.sh
set -e
LLAMA_DIR="$HOME/llama.cpp.cuda"
BUILD_DIR="$LLAMA_DIR/build"
CORES=$(nproc)
echo "🔄 更新 llama.cpp ..."
# 1. 先停止現有服務
if [ -f /tmp/llama-server.pid ]; then
OLD_PID=$(cat /tmp/llama-server.pid)
if kill -0 "$OLD_PID" 2>/dev/null; then
echo "🔴 停止現有服務 (PID $OLD_PID)..."
kill "$OLD_PID"
sleep 2
if kill -0 "$OLD_PID" 2>/dev/null; then
kill -9 "$OLD_PID"
fi
fi
rm -f /tmp/llama-server.pid
fi
# 2. 拉最新原始碼
cd "$LLAMA_DIR"
echo "📥 git pull..."
git pull --ff-only
# 3. 重新 cmake 設定 + 編譯(CUDA 加速)
echo "🔧 cmake 設定..."
cd "$LLAMA_DIR"
cmake -B build -DGGML_CUDA=ON
echo "🔧 編譯中(使用 $CORES 線程)..."
cmake --build build --config Release -j "$CORES"
# 4. 驗證
echo "✅ 編譯完成!"
ls -lh "$BUILD_DIR/bin/llama-server"
echo "---"
echo "🟢 請執行以下指令重啟服務:"
echo " ~/llama-cuda-qwen3.6-Q5-mtp.sh"
以上是粗淺的心得,速度沒有單一張7900XTX猛暴,但這老卡勝在便宜,疊兩張得到44GB VRAM,AI都給我信心加持說這已將很划算,性能表現也很正常
。我不知道的東西還是太多了,大部分都是問AI然後貼上,或是AI幫我改,煩請各位大神不吝賜教,謝謝。
小弟自從接觸了老特說開始對本地AI萌生興趣,因為公司網路限制很多,封鎖大部分的AI domain,而且就算找到可以連的雲端AI,使用幾個小時下班前DLP告警就噴了幾百筆,嚇的我不敢再用,然後就腦筋就動到外接這招。
最近從淘寶買了一組需要自己DIY組裝的顯卡塢,連接方案我挑的是SlimSAS轉接卡不是常見的OCuLink/雷電,因為我們公司就是很常見的品牌套機,這些接口不存在的,本身就重加上電源供應器、7900XTX整組拎去公司簡直像舉啞鈴重訓一樣
費了一番力氣組裝好,裝好最新amd驅動,打開 GPUZ,有跑滿i5-9500世代的PCIE 3.0x16,實際表現因為才體驗一個多小時還沒有測太多,掛Qwen3.6-27b-Q4_K_M,文字推理一秒可以噴4x-5xT/s,個人覺得滿意,終於可以開始享受上班玩本地AI了。
確實啊,我身邊的親友不管我怎麼吹我的agent多好用,結果他們看到命令列就沒興趣了,今天我轉給他們看那美觀的官網和安裝後的視窗介面馬上就吸引幾個去裝了
請問您會讓它24小時運轉嗎?畢竟是當agent用。
各位大佬好,小弟從老特到掄錘者頻道看了一輪,再到論壇開張至今大多數內人都看過,最近也在採購各種二手零件想搞一台本地AI運算工作站體驗一把,cpu、主板、記憶體、機殼、電供陸續到位,淘寶下單的顯卡rtx4080s 32g已清關預計這週到手,系統預計直接安裝ubuntu,現在只差儲存的選擇,我手上有幾顆以前存著的ssd(512~2tb都有),這部分較少看到有人討論,問了ai建議系統碟越大越好:
Ubuntu AI 環境的「預設路徑」陷阱(系統碟容量痛點)
在建置 Linux AI 工作站時,即使您規劃了許多高容量的 NVMe/SATA 資料碟,系統碟如果只有 500GB,很快就會面臨空間窒息。
Docker 鏡像與容器:AI 開發極度依賴 Docker(例如各式各樣的 CUDA、PyTorch 鏡像),而 Docker 預設的儲存路徑在 /var/lib/docker(屬於系統碟)。一個完整的 AI 開發鏡像動輒 15GB ~ 30GB,多下載幾個版本或建立幾個容器,幾百 GB 就消失了。
環境與快取(Cache):Python 的 pip 快取、Hugging Face 下載模型的預設快取路徑(~/.cache/huggingface)、Ollama 的模型路徑(~/.ollama),預設全部都在系統碟的家目錄(Home Directory)下。
結論:如果工作站用 500GB 當系統碟,您必須花費大量精力去修改 Docker 全域設定、手動建立軟連結(Symlink)或調整環境變數(如 HF_HOME)來將資料強制導向資料碟。若直接使用 1TB 的 Samsung PM9A1,能提供極為充裕的緩衝空間,省去頻繁整理系統碟的痛苦。
想問大佬們實務上也是選用大容量作為系統碟嗎?請問不吝賜教,謝謝!
小弟也是超級新手一個,我的規劃跟樓主一樣,agent一台、gpu主機一台,後者還在籌組中,agent前幾天有在論壇中請教過,可以拿閒置的小電腦來裝,只是我今天突然想到我有台24時不關機的synology nas,用docker跑hermes agent是不是也可以,查找了一下網路和問ai似乎是沒問題的,準備開工了!
感謝回覆,因為不想把代理部署在主力機上面怕系統被搞壞,幫agent準備一台小電腦,然後遠端呼叫它做事感覺比較放心
@xiaote
不好意思小弟是超級ai小白,請問我可以把Hermes agent 部署在一台小主機上,然後透過手機或筆電上app例如tg、line跟agent溝通嗎?
我是老特的台灣youtube潛水觀眾,看到這篇快笑死了
,也太佩服站長,太有才了,論壇居然還可以接入ai