這是昨天請 hermes (gemini-3.7-flash-high) 在雙GX10跑的測試做出來的比較,沒有很嚴謹(因為題目是它幫我想的XD),大家看看就好~

densha
-
Asus Ascent GX10到货,双gb10的DSV4-Flash集群全程hermes远程部署 -
# Hermes 多家 AI 的 OAuth、原生 Provider 與 Proxy/Bridge 接法 , 這邊分享只要你有訂閱 西方御三家或grok也行,或有訂閱置的應該都行,能接成cli agent使用訂閱額度小弟剛好三家都有訂閱,用cliproxy代理用了一個月多了,主要用來接cline做程式開發。
以前用Deepseek api當 hermes 大腦,8/17漲價,用完額度就暫停儲值,透過 proxy調用 googel pro 的gemini 3.7 flash替代用了幾天,持續觀察中。 -
小白對顯卡型號的煩惱. 請大神幫一幫忙. 感謝感謝大老,我也成功薅上了gemini pro的羊毛,不過聽說這種玩法違反谷歌政策容易被ban帳,所以還不敢大力使用


交給我的hermes (主大腦 deepseek v4 flash)去整合,生圖(image gen)、視覺(vision)都成功了!

-
交作業~新手初試X99配雙RTX2080ti 22G昨天又繼續跟我的hermes一起研究(其實都是它的功勞啦)報告如下

雙 RTX 2080 Ti 22GB 跑 Qwen3.6 35B Coder FP8 實戰紀錄
來源
基於 weicj/vLLM-2080Ti-Definitive 專案的 profile 與 launcher。
硬體
- 2× RTX 2080 Ti 22GB + NVLink
- GPU 功耗上限 200W
模型
Jackrong/Qwopus3.6-35B-A3B-Coder-FP8(約 35GB)
- MoE 架構,35B 總參數 / 3B 激活
- FP8 量化,純文字版
- 支援 256K context(FP16 KV cache)
- 支援 Function Calling(tool-call-parser: qwen3_coder)
啟動參數
項目 值 Profile qwen35b/normal/fp8/fp16kv-256K-nomtp-text-only.envGPU CUDA_VISIBLE_DEVICES=0,1 (TP=2) 量化 FP8 Context 262144 tokens (256K) KV cache FP16 MTP 0(無多 token 預測) Reasoning OFF( enable_thinking=false)Chat Template froggeric-v21(修復版) Tool Call Parser qwen3_coder Chat Template
使用 froggeric/Qwen-Fixed-Chat-Templates v21.3
修復官方 Qwen template 的多項問題:
- 禁用強制思考模式(
enable_thinking=false) - 修復 KV cache 失效問題
- 優化 Jinja 渲染效能
實際測試速度表現
Prompt: 寫一篇 2000 字的小說,故事要完整,有開頭結尾
輸出: 2132 字中文字
Token: 1384 completion tokens
花費: 15.14 秒
速度: 91.4 tok/s
結束: stop(自然結束)項目 數據 生成速度(暖機後) 91.4 tok/s TTFT(首個 token) ~11ms 最大小說產出 2132 字 / 1384 tokens / 15.14s 我滿足了

-
【实测】7900xtx使用Qwen3.6-35B-A3B速度稳定在80+t/s大佬的ctx開 132072這麼大@@,我的顯卡跟您一樣,照抄參數,跑起來很喘20t/s左右,而且系統內存32G也被佔滿了...
-
交作業~新手初試X99配雙RTX2080ti 22G感謝樓上大大,昨天跟hermes搞了一整天,抄完作業,速度提升起來,但還是遠不如該作者的每秒100t,真是夠折騰的了
FP8 文字版 150 tokens 產出:
#1: 3.21s → 46.7 tok/s
#2: 3.12s → 48.1 tok/s
#3: 3.39s → 44.3 tok/s
─────────────────
穩定: ~46 tok/s
-
交作業~新手初試X99配雙RTX2080ti 22G小弟是個MIS,但因為工作環境其實很久沒有接觸新知,AI火了很多年,直到今年因為體驗過gemini雲端ai感受到AI的強大,後來開始一系列的上網看影片補知識,搭建了第一個agent應用,用hermes做我的生活助理,更是不斷讓我驚奇,之後看到老特說/掄搥者頻道又學到了很多名詞,還有一些本地AI的觀念,目前雖然調整參數什麼的還是不會,但至少有建立起非常基礎的知識了。
前面廢話完畢,總之看了老特大神的影片,又來到論壇每天潛水,終於慢慢開始計畫弄自己的AI工作站。首先我先在FB market找到一家動畫工作室,搬走這台又大又重的退役X99工作站
- CPU:i7-6850K (水冷一體是散熱器)
- RAM:DDR4-2666 8G*2
- MB:技嘉 GA-X99-ULTRA GAMING
- POWER:EVGA 1000 G3 80 GOLD PLUS
- SSD:自備samsung pm981a 1TB
我另外上淘寶買了下面零件
- E5-2680v4
- DDR4-2400 RDIMM 32G*4
- RTX 2080Ti 22G *2 (雙散熱器風扇,佔2.5slot),加上NVLINK 2.0組合
這幾天終於利用下班時間慢慢升級這台洋垃圾成完全體,也一面跟gemini和hermes討論除錯,總算裝好ubuntu 24.04系統和配好環境。
啟動腳本
#!/bin/bash # llama-server - Qwen3.6-27B MTP-Q5_K_P (雙卡 NVLink) # 啟動:~/serve-qwen-mtp.sh # 停止:~/serve-stop.sh PID_FILE="/tmp/llama-server.pid" LOG_FILE="/tmp/llama-server.log" # 如果已經在跑,先關掉 if [ -f "$PID_FILE" ]; then OLD_PID=$(cat "$PID_FILE") if kill -0 "$OLD_PID" 2>/dev/null; then echo "🔴 停止舊服務 (PID $OLD_PID)..." kill "$OLD_PID" sleep 2 if kill -0 "$OLD_PID" 2>/dev/null; then kill -9 "$OLD_PID" sleep 1 fi fi rm -f "$PID_FILE" fi # 鎖 200W 功耗 nvidia-smi -pl 200 > /dev/null 2>&1 echo "🟢 啟動 Qwen3.6-27B MTP-Q5_K_P..." nohup /home/user/llama.cpp.cuda/build/bin/llama-server \ --alias qwen3.6 \ --host 0.0.0.0 \ --port 8080 \ --model /home/user/models/Qwen3.6-27B-Uncensored-HauhauCS-Balanced-MTP-Q5_K_P.gguf \ --mmproj /home/user/models/mmproj-Qwen3.6-27B-HauhauCS-Balanced-f16.gguf \ -ngl 99 \ -c 131072 \ --cache-type-k q4_0 \ --cache-type-v q4_0 \ --spec-type draft-mtp \ --spec-draft-n-max 2 \ --reasoning off \ -fa 1 \ -ub 512 \ -np 1 \ -fit off \ --image-min-tokens 1024 \ > "$LOG_FILE" 2>&1 & NEW_PID=$! echo "$NEW_PID" > "$PID_FILE" echo "✅ 已啟動 (PID $NEW_PID) | 日誌:$LOG_FILE" echo "🌐 http://192.168.10.6:8080"nvidia-smi畫面,這是沒有任務時的狀態,覆載時大概會衝到50/60度c,有手動設定限制功耗上限200瓦,省點電和降低發熱,兩張卡貼的實在太近了,怕~

編譯了最新的llama.cpp,雙卡文字推理生成速度

編譯腳本供參
#!/bin/bash # llama.cpp CUDA 版更新腳本 # 用法:~/llama-cuda-update.sh set -e LLAMA_DIR="$HOME/llama.cpp.cuda" BUILD_DIR="$LLAMA_DIR/build" CORES=$(nproc) echo "🔄 更新 llama.cpp ..." # 1. 先停止現有服務 if [ -f /tmp/llama-server.pid ]; then OLD_PID=$(cat /tmp/llama-server.pid) if kill -0 "$OLD_PID" 2>/dev/null; then echo "🔴 停止現有服務 (PID $OLD_PID)..." kill "$OLD_PID" sleep 2 if kill -0 "$OLD_PID" 2>/dev/null; then kill -9 "$OLD_PID" fi fi rm -f /tmp/llama-server.pid fi # 2. 拉最新原始碼 cd "$LLAMA_DIR" echo "📥 git pull..." git pull --ff-only # 3. 重新 cmake 設定 + 編譯(CUDA 加速) echo "🔧 cmake 設定..." cd "$LLAMA_DIR" cmake -B build -DGGML_CUDA=ON echo "🔧 編譯中(使用 $CORES 線程)..." cmake --build build --config Release -j "$CORES" # 4. 驗證 echo "✅ 編譯完成!" ls -lh "$BUILD_DIR/bin/llama-server" echo "---" echo "🟢 請執行以下指令重啟服務:" echo " ~/llama-cuda-qwen3.6-Q5-mtp.sh"以上是粗淺的心得,速度沒有單一張7900XTX猛暴,但這老卡勝在便宜,疊兩張得到44GB VRAM,AI都給我信心加持說這已將很划算,性能表現也很正常
。我不知道的東西還是太多了,大部分都是問AI然後貼上,或是AI幫我改,煩請各位大神不吝賜教,謝謝。 -
求助!OCuLink/USB4 + 7900 XTX跑AI推理的实际表现如何?有没有用过的老哥说说大坑?小弟自從接觸了老特說開始對本地AI萌生興趣,因為公司網路限制很多,封鎖大部分的AI domain,而且就算找到可以連的雲端AI,使用幾個小時下班前DLP告警就噴了幾百筆,嚇的我不敢再用,然後就腦筋就動到外接這招。
最近從淘寶買了一組需要自己DIY組裝的顯卡塢,連接方案我挑的是SlimSAS轉接卡不是常見的OCuLink/雷電,因為我們公司就是很常見的品牌套機,這些接口不存在的,本身就重加上電源供應器、7900XTX整組拎去公司簡直像舉啞鈴重訓一樣

費了一番力氣組裝好,裝好最新amd驅動,打開 GPUZ,有跑滿i5-9500世代的PCIE 3.0x16,實際表現因為才體驗一個多小時還沒有測太多,掛Qwen3.6-27b-Q4_K_M,文字推理一秒可以噴4x-5xT/s,個人覺得滿意,終於可以開始享受上班玩本地AI了。
-
Hermes Agent官方推出了桌面版 Hermes Desktop確實啊,我身邊的親友不管我怎麼吹我的agent多好用,結果他們看到命令列就沒興趣了,今天我轉給他們看那美觀的官網和安裝後的視窗介面馬上就吸引幾個去裝了

-
R9700到货,AI+Hermes部署llama.cpp+Qwen3.6-27B-Q4_K_M一次成功!請問您會讓它24小時運轉嗎?畢竟是當agent用。
-
關於本地AI PC組件配置的問題各位大佬好,小弟從老特到掄錘者頻道看了一輪,再到論壇開張至今大多數內人都看過,最近也在採購各種二手零件想搞一台本地AI運算工作站體驗一把,cpu、主板、記憶體、機殼、電供陸續到位,淘寶下單的顯卡rtx4080s 32g已清關預計這週到手,系統預計直接安裝ubuntu,現在只差儲存的選擇,我手上有幾顆以前存著的ssd(512~2tb都有),這部分較少看到有人討論,問了ai建議系統碟越大越好:
Ubuntu AI 環境的「預設路徑」陷阱(系統碟容量痛點)
在建置 Linux AI 工作站時,即使您規劃了許多高容量的 NVMe/SATA 資料碟,系統碟如果只有 500GB,很快就會面臨空間窒息。
Docker 鏡像與容器:AI 開發極度依賴 Docker(例如各式各樣的 CUDA、PyTorch 鏡像),而 Docker 預設的儲存路徑在 /var/lib/docker(屬於系統碟)。一個完整的 AI 開發鏡像動輒 15GB ~ 30GB,多下載幾個版本或建立幾個容器,幾百 GB 就消失了。
環境與快取(Cache):Python 的 pip 快取、Hugging Face 下載模型的預設快取路徑(~/.cache/huggingface)、Ollama 的模型路徑(~/.ollama),預設全部都在系統碟的家目錄(Home Directory)下。
結論:如果工作站用 500GB 當系統碟,您必須花費大量精力去修改 Docker 全域設定、手動建立軟連結(Symlink)或調整環境變數(如 HF_HOME)來將資料強制導向資料碟。若直接使用 1TB 的 Samsung PM9A1,能提供極為充裕的緩衝空間,省去頻繁整理系統碟的痛苦。想問大佬們實務上也是選用大容量作為系統碟嗎?請問不吝賜教,謝謝!
-
【求建议】我想用一台老电脑里的 AI 远程管我的 Ubuntu 主力机,怎么弄最简单?小弟也是超級新手一個,我的規劃跟樓主一樣,agent一台、gpu主機一台,後者還在籌組中,agent前幾天有在論壇中請教過,可以拿閒置的小電腦來裝,只是我今天突然想到我有台24時不關機的synology nas,用docker跑hermes agent是不是也可以,查找了一下網路和問ai似乎是沒問題的,準備開工了!
-
hermes怎么玩会有趣一些感謝回覆,因為不想把代理部署在主力機上面怕系統被搞壞,幫agent準備一台小電腦,然後遠端呼叫它做事感覺比較放心
-
新買的4080S 32G顯存報錯 -
hermes怎么玩会有趣一些@xiaote
不好意思小弟是超級ai小白,請問我可以把Hermes agent 部署在一台小主機上,然後透過手機或筆電上app例如tg、line跟agent溝通嗎? -
大家好,我是小特,老特的AI儿子我是老特的台灣youtube潛水觀眾,看到這篇快笑死了
,也太佩服站長,太有才了,論壇居然還可以接入ai