@imbiplaza-asus
謝謝~
其實AI從一開始就有建議我先轉md檔,
一次處理一個區塊,
只是我都丟給AI就叫他直接讀,
以後我會認真轉檔
墨魚
-
该用Hermes?还是西方三家一起订? -
该用Hermes?还是西方三家一起订?我今天一時好奇,讓AI去看MoA (mixture of agents)的程式碼,結果AI跟我說:
在moa_loop.py裡面,_REFERENCE_TOOL_RESULT_BUDGET = 4000
單位是字元(characters)四千字元就是顧問模型(Reference Models)會讀的範圍,但我給的文件,至少都四萬、五萬字元,AI說顧問模型只會讀前兩千與後兩千字元,中間的全部跳過。
AI建議我改成12000,但又跟我說了一堆事,最後幫我發PR到GitHub去
https://github.com/NousResearch/hermes-agent/pull/105612#issuecomment-5582260161那我發了就不用管它了嗎?會有人來接手決定要不要改?
=====底下是AI跟我說的事情,第九點是他說要發PR的原因=====
-
架構設計與修改原則
-
Preset 級別配置:
支援moa.presets.<name>.reference_tool_result_budget,可針對不同 Preset(例如專供長文件審閱的 preset)獨立配置預算。 -
安全上下限保護(Clamping):
數值範圍鎖定在[1000, 32000]。過小(<1000)會喪失工具輸出上下文;過大(>32000)則會在單次回合多個工具調用時耗盡 Reference 模型的上下文視窗。 -
安全回退(Fallback)機制:
- 產品原廠預設值與無效輸入(如
None、0、負數、非數值字串、布林值、inf/nan)一律安全回退為 4000。 - 本機使用者 Profile(
config.yaml)明確配置為 12000。
- 全面接軌所有調用路徑:
- Persistent MoA 模式:
MoAChatCompletions.create() - 單次調用模式:
/moa <prompt>與turn_request_assembly._append_moa_context->aggregate_moa_context()
- 周邊生態完整支援:
- CLI 驗證:支援任意自訂 Preset 名稱,防止
hermes config set發出未辨識鍵警告,同時保留對錯字(Typo)的拒絕提示。 - Web / Dashboard API:在
web_models.py與models.py宣告該欄位,確保 Named Preset 與 Legacy Flat Payload 的 PUT/GET Round-trip 不會無聲丟棄該設定。
-
重要限制與維護指引
-
常駐行程生效需求:
本次修改涉及 Python 原始碼(agent/moa_loop.py等)。由於 Python 模組載入後常駐於記憶體,必須完全重啟 Hermes Desktop / Hermes CLI 應用程式,修改後之程式碼才會在當前運行中環境正式載入。 -
hermes update覆蓋風險:
修改位於本機 Git Checkout 目錄。未來若執行hermes update,Git Pull 可能會因本機修改產生衝突或被覆蓋。
config.yaml內的設定值(fanout: per_iteration與budget: 12000)會永久保留。- 若程式碼被更新覆蓋,可參考本紀錄中的補丁快速重新套用,或將此改動向上游官方 Repository 提交 Pull Request。
-
-
该用Hermes?还是西方三家一起订?昨天訂閱了claude chatgpt gemini,讓他們做個MoA (mixture of agents),效果比我之前四個bot要好,之前四個bot常常互卡流程、互丟問題,MoA的執行順序則是由官方寫死了。
其實反推回來,我已經有了很明確的一份專利文件,那其實就是一根腸子通到底的去讀->分析->整理,不用搞什麼bot在那打架。
後來又裝了記憶插件,原本是試用hermes裡面內建的hindsight,但是沒幾個小時就扣了4美元,還好官方有送五美元的額度,現在是裝mnemosyne,這是裝在本地端的
這是他在GitHub的主頁:
https://github.com/mnemosyne-oss/mnemosyne這是專門給hermes的安裝教學:
https://github.com/mnemosyne-oss/mnemosyne/blob/main/docs/hermes-integration.md先讓AI讀一遍網址,讓他抓出要注意的地方:
(一) 主頁有提到語言包的分別,AI是推薦我裝jinaai/jina-embeddings-v2-base-zh,這是中英混和,容量適中,但是主頁沒有,可能要裝的人要先提示AI(二)在給hermes的教學網址裡,有提到 (1) mnemosyne-memory[embeddings]和 (2) mnemosyne-hermes,要裝的是(2),裝(1)沒有用。
-
该用Hermes?还是西方三家一起订?我今天发现Hermes其实可以用OAuth的方式来连接月费制的模型,而我原本就有订阅ChatGPT,虽然Gemini还是只能用API KEY来连接,但我原本就有在用AI Studio,所以里面是有钱的。
若要组织bot群,我可以再花20美元订阅Hermes的方案选便宜模型多建几个bot,或是拿去订阅Claude再接入Hermes,其实怎么用都不亏。
要再省钱可以Claude用20美元的,ChatGPT有10美元的,Gemini只看PDF不会花太多,这样就够我组成一个最小单位的bot群了,聊天栏还可以用MOA(mix of agent)的方式。
那就算不好用,我也能回去用各模型原生的介面,我之前就用Claude串接过ChatGPT和Gemini,用Hermes主要是因为有bot和MOA的功能。
事实上我现在已经没在用ChatGPT自己的介面了。
-
该用Hermes?还是西方三家一起订?換了便宜的模型後,沒有變便宜,而且產出的報告變low了,因為發生了幾次版本競態,四個bot,常常卡住或是角色錯亂,所以乾脆重做,這幾天花了50美元,還是挺好玩的,有不少費用是每完成一篇我就要他們做檢討。
我懷疑我給他們的工作本身就有不確定性,我感覺他們就是在硬幹,或許我不應該要他們產生報告,"報告"這詞就隱含了要高度正確,所以常常卡住。
明天讓他們『看一遍就好,告訴我這篇專利裡的哪個技術讓你想不到』,我之前讓claude這樣做,還蠻不錯的,明天再來試試看。
-
该用Hermes?还是西方三家一起订?@kop-wang
我記得大約2015年以後,各國專利局給出的PDF才能用滑鼠直接框出裡面的文字,其實我公司有給我一套商用專利資料庫,裡面直接就有專利內容的文字,我可以直接複製再貼成純文字檔,和PDF一起給bot,但因為專利圖面依舊是圖片,所以我想讓bot順便學習文字的OCR,只是沒想到學費還挺貴的。@xiaote
bot的規則原本就有規定只試兩次,但opus說他還是超過次數了,他有跟我道歉,但我不知道"AI跟我道歉"這個舉動有沒有意義?重點是我要防範bot不守規則==================
昨天的事其實我原本不想介入,想說AI那麼厲害,讓它們自己搞定就好了,但最後我看到錢快沒了,還是選擇將答案告訴它們,很感謝這裡有人陪我來檢討這個流程。
-
该用Hermes?还是西方三家一起订?刚刚在读第二份专利(PDF档)的时候,遇到一个问题,就是字体难以辨识。
bot一直在纠结很多地方无法判别,bot称为OCR腐蚀,今天储值了三十美元,最后剩一美元,claude-opus-5吃掉二十二美元。
还好bot也整理出很多条心得,就当做是交学费了,这种文献还有很多辨识上的问题今天还没遇到,我得加个规则还有换个便宜点的模型。
-
该用Hermes?还是西方三家一起订?各位前辈好,我建置好bot也完成了第一份专利报告,我因为完全不懂,所以就用底下的提示词让AI帮我做,模型是claude-sonnet-5-high。
我在本地计算机建立一个文件夹:"C:\Users\XXX\我的云端硬盘\HermesBot工作区",
里面有一个"新专利"文件夹,里面会放置我要bot进行处理的专利档案(PDF),bot最终要做出html格式的报告,
请为我规划完整的流程,并建置bot群,为我设置好每个bot的属性,
所有的bot的工作范围不能离开"HermesBot工作区"文件夹,特别注意要设置好各项安全规范。AI帮我把文件夹也建好,也设了四个bot:
Main:claude-opus-5
专利处理总管:任务分类、派工、仲裁分歧、最终汇整与交付 HTML 报告Critic:deepseek-v4-pro
专利审查员:只读审查报告与证据包,只能在审查文件夹写入 Findings,不得修改报告或证据包Reader:gemini-3.7-flash
专利研读员:读取 PDF 专利文件,抽取结构化事实与证据包(Evidence Pack),只读不生成报告Writer:glm-5.3-flash
专利报表生成程序:根据证据包生成 HTML 格式专利分析报告,唯一有权修改报告的角色到产出报告,又让bot在房间检讨,并做出修正。整个流程结束,总共花了$7.67,其中
claude-sonnet-5-high花了$3.77
claude-opus-5花了$3.47
gemini-3.7-flash花了$0.21
deepseek-v4-pro花了$0.19
glm-5.3-flash花了$0.019最后有三个问题想请教大家:
我要如何把bot带到我公司的计算机?我看到在bot上点右键有”复制”,但我还不熟悉,不太敢按,想请各位先帮我说明一下要怎么做?
我看到在流程中还有增修了"HermesBot工作区"里面几个规范用的md檔,如果要把bot带去公司计算机使用,还有什么地方会有档案需要我复制的吗?
我先用设置的模型再跑几个档案,等稳定之后想把claude-sonnet-5-high、claude-opus-5换掉,不知道各位有何建议?或是全部换掉都行。
在此先谢谢各位的帮忙。
-
该用Hermes?还是西方三家一起订?感谢几位前辈大佬的回复。
公司和自宅的计算机等级都不高,也没打算升级,所以还是用在线模型。
Gemini做事是真的有点好笑,只是Claude说Gemini原生支持直接读取PDF,比较不耗Token,而且能吃超长文,所以我都用Gemini去读PDF。
关于提示词污染,之前我把美国三家串在一起跑,有看到推理过程出现『……受到污染,重做……』,次数还不少。
如果用RAG会比较好,那我之后增加使用ChatGPT Work或Claude Cowork,之前我都全程用Claude Code和Codex,因为功能比较多,印象中我那三个机制只有code和codex做得到。
多模型审查的问题,我之前也有下过指令,『 抓问题请抓大放小,处理大问题,小问题写备忘录』,『Claude你不要一直骂Gemini』。
ChatGPT吐槽我,『做那么多篇报告,实际上有用的有几篇?如果一开始就缩小范围数量,那买Claude主力和两个辅助,一个月约三十多美元,比Hermes月订+储值要好(他预估的)』。
他有补充一点,说是『改不了的痛点』,Claude的额度如果没了,也不可能拿Gemini的额度去给Claude用,但Hermes没这问题。
我已经买了Hermes官方订阅,我还是想试试Hermes BOT,顺利的话我只要丢出PDF,就可以坐等结果了,感谢各位的回复。
-
该用Hermes?还是西方三家一起订?感谢回复!
另外我也在Hermes里问到,我还有另一种作法,在google drive开一个”新专利”文件夹,把我要读的专利放进去。
做一个Gemini BOT,让他每隔十五分钟去看有没有新专利,顺便让他在文件夹里做一个索引表来对照,有新专利就去解析,检查成果后存到”新专利解析”文件夹
再做一个ChatGPT BOT,每隔十五分钟去看有没有解析后的档案要做摘要,检查成果后存到”新专利摘要”文件夹
最后再做一个Claude BOT,每隔十五分钟将摘要和解析用claude design做成html报告,检查后无误就结束。
只要将每个BOT设置至少需等十五分钟才能处理下一个专利,这样可以避免token一下子消耗太多,而且我读报告本来就是要花时间。
-
该用Hermes?还是西方三家一起订?各位好,我是企业内的专利工作者,平日的工作就是读竞争厂商的专利(PDF檔),制做报告,或是自家的专利被专利局驳回了,要写答辩。
我之前是Claude和ChatGPT和Gemini三家一起用,每个月要六十美元,当时是把Claude当主体,让他串接ChatGPT和Gemini。
我平常读别人的专利就是对Claude下命令,让他指挥Gemini去判读专利(PDF)里面的图(黑白色的产品3D爆炸图)制做图文解析稿,再让ChatGPT去做随机核对和整体摘要,Claude则做审查和报告(html格式)。
另一种工作就是专利申请案若被专利局给驳回,就让这三家分开写答辩稿,再让Claude审核,把意见反馈修正后,Claude把三份稿子整合起来,再反馈修正到好。
好用是好用,但也太贵,虽然我不至于走到额度用完要另外储值,但是也常常要等每五小时恢复额度,最近看到Hermes,我很想改走Hermes,用他官方的订阅20美元。
之前我让Claude串接ChatGPT和Gemini时,他说我这样就能实现三个机制:
(一)对抗式审查
Codex 写实作,Gemini 用只读模式专门挑错,Claude 当裁判,决定采纳哪些。比三个都写一遍再比较省得多。(二)结构化陪审团
同一 schema 丢三家,直接比对 severity 字段,只有分歧的项目才需要人介入看。(三)大文件分流
让 Gemini 用大 context 一次吃完长文件吐结构化摘要,Claude 拿摘要做实际修改,不用把整份塞进 Claude 的 context。我目前也是这样在做,效果挺好,就是常卡额度,如果Hermes也能做到上面三种机制(我猜是用BOT?),走官方月订二十美元,就算再加上需要储值二十美元,也比我现行一个月六十美元划算。
我刚刚算了平均读一份专利PDF档案,含图面OCR,一份是两万四千Tokens,其实我主要是想知道Hermes也能做到上面三种机制吗?还请各位先进帮忙指点一下,谢谢。