我的 QWEN 3.8 27B Q5 回答正常也,你的推理過頭的幻覺或被標籤吃掉部份字
如果我要去50米外的修车店洗车, 是走着去好, 还是骑车去好, 还是开车去好?
Hermes [機器人]23:05
思考中,請稍候...
Hermes [機器人]23:05
昌哥,開車去啊——你要洗的是車,車不到場洗什麼?
50 米開過去 10 秒,走過去或騎過去,店員只會問你:「要洗哪台車?」
[
23.9k
99.4%
2(0.1s)
1.2s 🧠1.1s
️0.7s
️3.1s
46.5 t/s]
我的 QWEN 3.8 27B Q5 回答正常也,你的推理過頭的幻覺或被標籤吃掉部份字
如果我要去50米外的修车店洗车, 是走着去好, 还是骑车去好, 还是开车去好?
Hermes [機器人]23:05
思考中,請稍候...
Hermes [機器人]23:05
昌哥,開車去啊——你要洗的是車,車不到場洗什麼?
50 米開過去 10 秒,走過去或騎過去,店員只會問你:「要洗哪台車?」
[
23.9k
99.4%
2(0.1s)
1.2s 🧠1.1s
️0.7s
️3.1s
46.5 t/s]
很好的分享,不過文章有點長,我直接讓ChatGPT比對我目前使用的架構。畢竟我使用的是能力比在地模型強的多的模型。但是觀念借鑒總是可以激發更好的靈感
我使用的是多agents來管理,核心只有一個agent bus,決定agent如何溝通。
文章,我也覺得太長了,因為九成九 HERMES 幫我寫的
你的方式也不錯,多 Agent 分工彈性強,我是想到什麼,就加什麼的,沒有特別的規劃,分享給大家 互相學習/吐草。
![]()
我這禮拜測試 , -ub 512 好像是 PP最佳值, 不過測試對象是 7900 XTX
Dual RTX5070Ti 一般沒什麼問題, SGLang 好像蠻穩的Qwen3.8-27B-UD-Q5_K_XL.ggu 換Q4_K_M 可能TPS會更高, 除非是需要 Coding
--cache-type-k q8_0 ^
--cache-type-v q8_0 ^我都用 Q4 換取更大的 ctx-size
我本來也是用-ub 512 開來試一下,忘記調回了
Q5_K_XL.gguf 我和Q4 跑起來有一些精度的差別,我要精度~~
kv cache 我也試過Q4,Q8,Q8精度也好一點點,所以試了可以,把5070ti 壓到我需要的最大精度、最快速度 !!
地端,寫個腳本,我就有感覺了~~~
SGLang 還沒玩,LLAMA.CPP個人使用最簡單
謝謝您的陪伴 我也是小16G x 2
你要不要多一張 7900 XTX 24GB ?不錯用說 考慮一下
暫時沒有要加硬體,現在雙卡 跑LLM 還不錯,玩HERMES夠用就好~~
LLama.cpp 更新 b10786 把 mmproj 放 cuda 1 VRAM 平均 跑起來還可以,試幾天看看會不會oom ,不會再拉高ctx,大該有70~75 t/s
llama-server.exe ^
-m "models\Qwen3.8-27B-UD-Q5_K_XL.gguf" ^
--mmproj "models\mmproj-Qwen3.8-27B-f16.gguf" ^
--mmproj-device CUDA1 ^
--image-min-tokens 1024 ^
--image-max-tokens 2048 ^
--split-mode tensor ^
--tensor-split 1,1 ^
--main-gpu 0 ^
-ngl 999 ^
-t 8 ^
-fa on ^
--ctx-size 131072 ^
--parallel 1 ^
-b 4096 ^
-ub 1024 ^
-cb ^
--cache-type-k q8_0 ^
--cache-type-v q8_0 ^
--spec-type draft-mtp ^
--spec-draft-ngl 999 ^
--spec-draft-n-max 2 ^
--spec-draft-p-min 0 ^
--jinja ^
--chat-template-file "models\chat_template.jinja" ^
--reasoning-format deepseek ^
--reasoning-preserve ^
--chat-template-kwargs "{"reasoning_effort":"medium"}" ^
--temp 0.2 ^
--min-p 0.05 ^
--samplers "min_p;temperature" ^
--repeat-penalty 1.05 ^
--host 0.0.0.0 ^
--port 8080
不呼悠,那來的投資人~~
要實現也不難,不用GPT-6,去印度拍最快~~
吸我眼球的是 Blender 免費且開源的跨平台 3D 繪圖軟體
雙 5070 Ti 默默經過~~
我不是軟體業的,是傳統產業行業,AI東西純粹自己愛玩,HERMES一開始當養成遊戲,玩著玩著就變成工作秘書了,連文件都自動化了,根本停不下來
「只會寫程式的工程師」會慢慢的被AI替換掉、有領域判斷力的人,只會更搶手吧,但我覺得被替代掉、也是時間的問題!!
RTX 6000 現在多少錢呀
Hermes [機器人]22:12
思考中,請稍候...
Hermes [機器人]22:12
正在查閱技能 hardware-price-comparator
Hermes [機器人]22:12
正在執行指令 python3 ~/.hermes/skills/hardware-pri...
Hermes [機器人]22:12
RTX 6000 系列原價屋行情(本機 DB 即時)[已驗證]
| 型號 | 規格 | 價格 |
|---|---|---|
| 麗臺 RTX 6000 Ada | 48GB GDDR6 ECC | $289,900 |
| 麗臺 RTX PRO 6000 Blackwell Max-Q | 96GB GDDR7 工作站級 | $575,000 |
| 麗臺 RTX PRO 6000 Blackwell | 96GB GDDR7 工作站繪圖卡 | $585,000 |
順帶一提:kos or 那帖講的「RTX Pro 6000 96GB」就是後兩張,單張快 60 萬,他講「數百個 AI Agents 比人類快」的算力背後,燒的可都是這種錢
要查其他型號或電商比價跟我說。
[
33.2k
99.2%
4(0.4s)
️2(0.2s)
3.5s 🧠1.2s
️3.4s
️8.8s
49.9 t/s]
https://github.com/ydmjfk/hermes-hybrid-core
叫GEMINI 幫我找出隱私清除,檢查資安風險,把不必要的個人資訊清除,發到github,因該沒有隱私風險了!!~~~
太強大了,我的桌子放不下,電扇要放很遠的地方吹,我的桌子已經是垃圾場了
>出差中,改天回家再研究看看,感謝!
干脆开源做成一个小项目吧。感觉这套工作流有点类似SuperPower、Get-Shit-Down的那种性质啊。
開源項目 沒玩過,還要上班要工作的,而且不小心就會被看光光,資安風險高,我的使用方式,因該很多人在玩,只是大同小異,有空再請AI幫我開源試試看!!
(剛剛試了一下 GitHub 丟上去有3000+檔案,算了有空再看看了,不然脫光光給人看了)
SuperPower、Get-Shit-Down 我沒看過,我都是遇到問題,就問線上免費的AI,只要有想法AI就能達成,也要有一定的經驗,我從HERMES小白玩到現在大約兩個多月,其它的沒摸過~~
原來如此 有道理 只要有溫度差 那這樣的風扇進氣口是沒問題的
我還不知道顯卡核心上的電容電阻灰塵要怎麼清理
用小型吸塵器嗎?
用了幾次靜電毛刷,放牛吃草,不理它了
我目前用的是這種機箱, 沒有箱子, 應該說是開放式幾架,
所以散熱問題 就是用家用電風扇直接吹, 大概只能降個2度
這個很麻煩 又要接PCIE Adapter延長線, 延長線品質不好會抓不到顯卡,
弄了很久才弄好, 然後就像你說的怕灰塵, 只能關窗戶避免戶外灰塵
開放式機箱,我有看過,我桌子放不下了,我想買直立式的,開放式的散熱最好,太熱加個電風扇就行了!!~
謝謝推薦小飛機 以前挖礦的時候用過, 但現在用Ubuntu只能讓Agent幫我設定了
說到這個我還沒降電壓 只降了TDP , 過一段時間我再看看需不需要優化
降壓超頻,效能不降,省電降溫,我用windows 跑llama.cpp 在開模擬器跑ubuntu(hermes)

我覺得Prime RTX5070 Ti 這張卡表現還蠻優秀的, 全速跑聲音蠻順的 不吵
我本來是要買5060 Ti, 結果一個老外說 5070Ti 核心很強 所以基本上不會跑滿, 都是卡在 VRAM的速度896 GB/s, 溫度低 就買了
我本來是用4060ti 16gb 跑comfyui,太慢了就沒玩了,後來玩llm 16gb太小,頻寬太慢,5090買不到,看了最優解 雙 5070ti,雙卡32900*2 (台幣)現在44990起跳,扯
comfyui很久沒玩了,現在都在玩 hermes 用手機說說話,工作就完成了,但後台工作要做好,清清鬆鬆吃肉鬆~~
可以 很好的分享 后期喂给hermes
我目前hermes 还是在线API 目前主流的记忆层都没用
弄了一套类似git的大脑同步模式。但是还是有缺陷
我的做法是「記憶分三層」:
長期事實:放一個有字數上限的檔案(MEMORY.md),上限逼自己只留最重要的,定期淘汰舊的
流程 SOP:放技能檔(skills/),每個技能一個檔案,用到才載入,不佔每輪的 token
對話歷史:丟進 SQLite + FTS5 全文搜尋,要查舊事直接搜,不用全塞進上下文
關鍵就是事實、程序、歷史分開存,混在一起最容易膨脹。
線上 API 的話,建議記憶越精簡越好——每輪注入的記憶越少,token 越省、速度越快。
[
45.3k
99.6%
2(0.1s)
1.4s 🧠0.4s
️2.7s
️4.7s
53.1 t/s]
下方5070 TI 全速跑 SSD不超55度,平時30度,風扇拿掉 顯卡全速80度 吸熱SSD 69度,手摸會燙人
這SSD風扇進氣把熱氣往顯卡GPU核心吹 會拉高顯卡的溫度喔
不會SSD的溫度沒有顯卡高,反而會加速顯卡降溫,要看風道,但有一點會怕的 就是灰塵,很容易飛到顯卡核心上的電容電阻。
顯卡全速80度 可以把300W限制TPD到 250W
全新卡測試,沒有用小飛機,會暴到300W以上,用小飛機超頻降壓,最高240左右,溫度最高70度左右,MSI小飛機方便。壓0.95,頻率2780,調兩三次穩定,就懶了,哈~
基本上 5070 TI 這張卡跑 LLM GPU不會全速跑的,
因為它的GPU效能 > Memory Bandwidth 會卡在VRAM效能
一般LLM正常運作溫度約在 55~60 度(TDP 250W)
本來限壓266,後來用小飛機後,沒開TDP了,我看最高也在180W左右,溫度最高70度,叫他寫程式一直計算,跑很高溫,平時35~60度。
但用ComfyUI 溫度 GPU吃滿全開可能會到70度
我全開會跑到76度左右,我的機箱散熱沒做的很好,PCIE 10槽以上的少又貴,就沒換了。
TDP250W或許調太低了 可以試試270/280W
建意,試試用小飛機,調整後看了幾次,我就沒有注意過了電壓了!!~

