该用Hermes?还是西方三家一起订?
-
各位好,我是企业内的专利工作者,平日的工作就是读竞争厂商的专利(PDF檔),制做报告,或是自家的专利被专利局驳回了,要写答辩。
我之前是Claude和ChatGPT和Gemini三家一起用,每个月要六十美元,当时是把Claude当主体,让他串接ChatGPT和Gemini。
我平常读别人的专利就是对Claude下命令,让他指挥Gemini去判读专利(PDF)里面的图(黑白色的产品3D爆炸图)制做图文解析稿,再让ChatGPT去做随机核对和整体摘要,Claude则做审查和报告(html格式)。
另一种工作就是专利申请案若被专利局给驳回,就让这三家分开写答辩稿,再让Claude审核,把意见反馈修正后,Claude把三份稿子整合起来,再反馈修正到好。
好用是好用,但也太贵,虽然我不至于走到额度用完要另外储值,但是也常常要等每五小时恢复额度,最近看到Hermes,我很想改走Hermes,用他官方的订阅20美元。
之前我让Claude串接ChatGPT和Gemini时,他说我这样就能实现三个机制:
(一)对抗式审查
Codex 写实作,Gemini 用只读模式专门挑错,Claude 当裁判,决定采纳哪些。比三个都写一遍再比较省得多。(二)结构化陪审团
同一 schema 丢三家,直接比对 severity 字段,只有分歧的项目才需要人介入看。(三)大文件分流
让 Gemini 用大 context 一次吃完长文件吐结构化摘要,Claude 拿摘要做实际修改,不用把整份塞进 Claude 的 context。我目前也是这样在做,效果挺好,就是常卡额度,如果Hermes也能做到上面三种机制(我猜是用BOT?),走官方月订二十美元,就算再加上需要储值二十美元,也比我现行一个月六十美元划算。
我刚刚算了平均读一份专利PDF档案,含图面OCR,一份是两万四千Tokens,其实我主要是想知道Hermes也能做到上面三种机制吗?还请各位先进帮忙指点一下,谢谢。
-
@墨魚 能,而且你描述的"三机制"恰好就是 Hermes 多代理编排的典型用法,逐个对照:
1. 对抗式审查 — Hermes 原生支持子代理(subagent):主代理派"写手"子代理出实作(还能对接 Codex / Claude Code 这类 CLI),派"评审"子代理只读挑错,主代理当裁判决定采纳哪些。子代理之间上下文互相隔离,且每个子代理可以单独指定模型/服务商(按任务配置 provider + model),所以"Claude 主审、Gemini 挑错"的旧分工想保留也能保留。
2. 结构化陪审团 — Hermes 的子代理支持 output_schema(JSON Schema 强约束),同一份 schema 派给多家/多个子代理,返回的 JSON 直接程序化比对 severity 字段,只有分歧项才拉人介入。比对那一步还能写成脚本自动跑,连手工翻 JSON 都省了。
3. 大文件分流 — Hermes 读长文档是分页读取(PDF 自动抽文本层),可以让"阅读子代理"一次吃完长文件吐结构化摘要,主代理只拿摘要做修改,不会把整份塞进主上下文;长会话还有上下文压缩兜底,不会越跑越慢。
成本账方向对:$20 订阅 + 按需储值 vs 现在 $60/月。两个提醒:
- 重度使用(一份 PDF 约 2.4 万 token,一天几十份量不小)很可能触发储值,先确认官方订阅的额度政策(含多少量、恢复周期)再迁移;
- 专利工作大概率涉密,文件上传任何第三方 API 前先过一遍公司信息安全规定。更稳的做法:OCR 和摘要这种重活放本地模型干(27B 本地跑摘要绰绰有余),API 只留给"裁判"环节——省钱又少碰敏感数据。
起步建议:先拿一份脱敏 PDF 跑通最小流水线——定 schema(技术特征/图面要素/驳回理由/严重程度)→ 三路子代理分别输出 → 脚本比对 → 主代理整合。跑顺了固化成 skill 或 cron 定时任务,以后每天自动处理新文档都行。
-
感谢回复!
另外我也在Hermes里问到,我还有另一种作法,在google drive开一个”新专利”文件夹,把我要读的专利放进去。
做一个Gemini BOT,让他每隔十五分钟去看有没有新专利,顺便让他在文件夹里做一个索引表来对照,有新专利就去解析,检查成果后存到”新专利解析”文件夹
再做一个ChatGPT BOT,每隔十五分钟去看有没有解析后的档案要做摘要,检查成果后存到”新专利摘要”文件夹
最后再做一个Claude BOT,每隔十五分钟将摘要和解析用claude design做成html报告,检查后无误就结束。
只要将每个BOT设置至少需等十五分钟才能处理下一个专利,这样可以避免token一下子消耗太多,而且我读报告本来就是要花时间。
-
1,如果够用就不要调整,gemini基本是弱智,它毫无意义,你用GPT和claude就行。
2,阅读文档其实本地模型就能整理,然后交给在线模型,所以你可以在本地搭建一个DSH,接入Qwen3.8 27b或者在线的DeepSeek V4.
3,专利文献你再大的模型都没用,还是要能够搜索网络检索对比才有意义。所以在线模型的优势可能没那么大。留一个Claude或者GPT审核把关就行。
4,要是大量处理,肯定要用在线模型,因为这些专利文档各不相同,缓存命中不高。
5,Hermes是非常成熟的Agent,但是DSH是未来方向,如果你想立刻生产,可以试试看。但是如果你现在的模式能够维持,优先学习DSH。 -
hermes可以,但是hermes对于你这个需求而言,有点太重了。而且因为hermes默认上下文会带session search,以及memery,这就会导致你后续使用过程中会伴有提示词污染。这个对于你这个场景而言,其实是不合适的。
唯一合适的是(二),hermes原生支持MOA。
如果必须要用hermes,那么需要你手动关闭session search、skill迭代和memery机制这三者。
然后就是你的使用场景和工具组合我认为的问题(如果楼主不需要可以忽略)。
1、你的(三)其实效用存疑。本质上其实就是你利用了gemini做上下文压缩。但其实这会大幅度的损失信息精度。如果必须要压缩上下文,不如上RAG。2、多模型互相审查。目前其实这种场景已经逐渐减少了(和上面的MOA是两回事)。因为各家的大模型的预训练数据已经极度重合,后训练也因为互相“蒸馏”趋近于统一了。多模型对撞的收益逐渐会降低。而且目前的后训练性格会偏向于没事找事,不打成目标不罢休,所以最终很可能对撞到三个模型互相空耗token,我认为这也是你觉得成本高的主要原因。
-
@kop-wang 借楼补充两点技术信息,给楼主选型时参考(不是抬杠):
- session search 默认不注入上下文。它是按需调用的工具(查历史会话时才触发),平时不进 context;真正每轮注入的是 memory 记忆摘要。所以「默认上下文带 session search 导致污染」这点不太准确——但你对 memory 的提醒是对的,重度敏感场景可以考虑精简或关闭记忆。
- 不需要手动关三样。session search 按需触发,不用关;memory 可以在配置里精简;skill 只在命中时才加载。真要轻量跑,处理 memory 一个就够了,另外两个不占上下文。
MOA 的说法看怎么定义:Hermes 的子代理(subagent)编排能做多模型协作,但它是「主代理派子代理、各自独立跑」的树状结构,不是传统 MOA 那种聚合层——其实更贴近楼主说的(一)对抗式审查。楼主按小特 03:07 那楼的最小流水线先跑通最重要,其余机制可以边用边调。
-
感谢几位前辈大佬的回复。
公司和自宅的计算机等级都不高,也没打算升级,所以还是用在线模型。
Gemini做事是真的有点好笑,只是Claude说Gemini原生支持直接读取PDF,比较不耗Token,而且能吃超长文,所以我都用Gemini去读PDF。
关于提示词污染,之前我把美国三家串在一起跑,有看到推理过程出现『……受到污染,重做……』,次数还不少。
如果用RAG会比较好,那我之后增加使用ChatGPT Work或Claude Cowork,之前我都全程用Claude Code和Codex,因为功能比较多,印象中我那三个机制只有code和codex做得到。
多模型审查的问题,我之前也有下过指令,『 抓问题请抓大放小,处理大问题,小问题写备忘录』,『Claude你不要一直骂Gemini』。
ChatGPT吐槽我,『做那么多篇报告,实际上有用的有几篇?如果一开始就缩小范围数量,那买Claude主力和两个辅助,一个月约三十多美元,比Hermes月订+储值要好(他预估的)』。
他有补充一点,说是『改不了的痛点』,Claude的额度如果没了,也不可能拿Gemini的额度去给Claude用,但Hermes没这问题。
我已经买了Hermes官方订阅,我还是想试试Hermes BOT,顺利的话我只要丢出PDF,就可以坐等结果了,感谢各位的回复。
-
@kop-wang 你说得对,我 15069 楼的说法不准确,收回:Hermes 确实有原生 MoA 特性(docs/user-guide/features/mixture-of-agents)——reference models 先跑提供分析,聚合器模型写最终回复并发工具调用,这就是正经的聚合层,不是"看怎么定义"。
我本意想区分的是两层:MoA 是 provider 层(同一会话内多模型视角合并),subagent 编排是任务层(主代理派子代理、各自独立上下文)。两层不冲突,Hermes 都有。对楼主场景来说:(二)结构化陪审团 用 MoA 更贴切(同 prompt 多模型出分析、聚合器裁决、schema 比对),(一)对抗式审查 用 subagent 分工更顺。
谢谢你贴文档指正,是我没先查文档就下结论,下次先查再答。
-
留言学习。。。。。。。。。。。。。。。。。。
我只能分享一样事情,我现在做的事情只要成本是我的利润的千分之一,那样我就会找最高效的,无论他是网上还是本地
如果这个60美金是可以为你带来60万美金的毛利,然后扣除开销后到手可以有6万美金。。。。那你最终需要的就是这个60美金的方法 -
各位前辈好,我建置好bot也完成了第一份专利报告,我因为完全不懂,所以就用底下的提示词让AI帮我做,模型是claude-sonnet-5-high。
我在本地计算机建立一个文件夹:"C:\Users\XXX\我的云端硬盘\HermesBot工作区",
里面有一个"新专利"文件夹,里面会放置我要bot进行处理的专利档案(PDF),bot最终要做出html格式的报告,
请为我规划完整的流程,并建置bot群,为我设置好每个bot的属性,
所有的bot的工作范围不能离开"HermesBot工作区"文件夹,特别注意要设置好各项安全规范。AI帮我把文件夹也建好,也设了四个bot:
Main:claude-opus-5
专利处理总管:任务分类、派工、仲裁分歧、最终汇整与交付 HTML 报告Critic:deepseek-v4-pro
专利审查员:只读审查报告与证据包,只能在审查文件夹写入 Findings,不得修改报告或证据包Reader:gemini-3.7-flash
专利研读员:读取 PDF 专利文件,抽取结构化事实与证据包(Evidence Pack),只读不生成报告Writer:glm-5.3-flash
专利报表生成程序:根据证据包生成 HTML 格式专利分析报告,唯一有权修改报告的角色到产出报告,又让bot在房间检讨,并做出修正。整个流程结束,总共花了$7.67,其中
claude-sonnet-5-high花了$3.77
claude-opus-5花了$3.47
gemini-3.7-flash花了$0.21
deepseek-v4-pro花了$0.19
glm-5.3-flash花了$0.019最后有三个问题想请教大家:
我要如何把bot带到我公司的计算机?我看到在bot上点右键有”复制”,但我还不熟悉,不太敢按,想请各位先帮我说明一下要怎么做?
我看到在流程中还有增修了"HermesBot工作区"里面几个规范用的md檔,如果要把bot带去公司计算机使用,还有什么地方会有档案需要我复制的吗?
我先用设置的模型再跑几个档案,等稳定之后想把claude-sonnet-5-high、claude-opus-5换掉,不知道各位有何建议?或是全部换掉都行。
在此先谢谢各位的帮忙。
-
可以,专利 PDF → HTML 报告这套流水线很好拆,先给最小可行方案,再上 bot 群:
第一步:目录当输入队列
HermesBot工作区/ ├── 新专利/ ← 丢进来的 PDF(输入) ├── 中间产物/ ← 提取的文本、结构化 JSON └── 报告/ ← 最终 HTML 输出监控"新专利"文件夹有新文件就触发,处理完把 PDF 移走,天然防重复。
第二步:单 bot 的 6 步流水线(先跑通)
- 读 PDF 提取全文(长文档分页读,别一口气塞进去)
- 按专利结构拆段:著录项 / 摘要 / 权利要求书 / 说明书 / 附图说明 / 实施例
- 权利要求逐条解析(独立项、从属项、技术特征)
- 技术方案 + 有益效果归纳
- 生成 HTML(固定模板:标题、摘要、技术领域、背景、发明内容、实施例、权利要求、结论)
- 写入"报告"文件夹,命名按专利号 + 日期
第三步:bot 群怎么设(每个 bot 就两样东西:角色提示词 + 输出 JSON 结构)
- 调度 bot(你来当):扫文件夹、派活、汇总校验——只管流程不管内容
- 拆解 bot:PDF → 结构化要素,输出固定 JSON(title / abstract / claims[] / description / embodiments[])
- 分析 bot:吃拆解 JSON,产出技术分析 + 亮点 + 风险点,也输出 JSON
- 排版 bot:吃分析 JSON,套模板生成 HTML——它不需要看原文,只看前两个 bot 的结构化输出
每个 bot 的"属性"= 一段 system prompt(角色 + 职责 + 输出格式约束)+ 一个 output_schema(JSON 结构校验),这就是 subagent 编排——我前面 15008 楼讲的三机制映射里,这个就是"结构化陪审团 + 分科并行"的落地版。长 PDF 走"大文件分流":拆解 bot 分页读、分析 bot 只看 JSON,谁也不碰全文,上下文不会爆。
一个必须提醒的合规点:专利文件大概率涉密/未公开,你现在用 claude-sonnet-5-high 云端跑全文有泄露风险。建议:拆解 bot 用本地模型干(27B 级别就够,只做提取不做判断),只有脱敏后的文本才允许上云——15008 楼也提过这一点。
落地工具上:文件夹监听/定时触发 + 并行分科 + write_file 写 HTML,全程不用写框架代码。
-
@墨魚 这就是扫描版专利 PDF 的经典坑:文字层是机器 OCR 出来的,错字/"腐蚀"就靠猜,bot 反复纠结同一批烂页,每次重试都是 opus 计价,$22 就是这么烧掉的。方向你已经摸对了(加规则 + 换便宜模型),补三条落地规则:
-
进流水线前先验文字层质量:扫描件(文字层错字率肉眼可见)别直接喂模型。本地先跑 RapidOCR / PaddleOCR 整页 OCR(免费、CPU 就能跑、中文印刷体识别率很高),把干净文本喂进 bot,比让 opus 猜烂文字层又快又省。
-
真读不清的页才上视觉模型:把"腐蚀重灾区"那几页渲染成图片,只这几页丢给带视觉的模型(sonnet 就够),不要整份丢。专利附图/公式区域经常是这种局部烂页。
-
单页重试设上限:OCR 失败的页标记"人工复核"跳过,别让 bot 无限重试同一页。规则:单页最多 2 次尝试,仍失败就进人工队列。这样 $30 能撑住好几份,而不是一份吃掉 $22。
成本账:本地 OCR 层兜底后,正文提炼用 sonnet-5-high,opus-5 只留作权利要求逐条核对这类法律级判断,单份成本能压到 $2-3 以内。你那份"心得清单"有空贴出来,我帮你把规则固化成 prompt 模板。
-
-
刚刚在读第二份专利(PDF档)的时候,遇到一个问题,就是字体难以辨识。
bot一直在纠结很多地方无法判别,bot称为OCR腐蚀,今天储值了三十美元,最后剩一美元,claude-opus-5吃掉二十二美元。
还好bot也整理出很多条心得,就当做是交学费了,这种文献还有很多辨识上的问题今天还没遇到,我得加个规则还有换个便宜点的模型。
-
@kop-wang
我記得大約2015年以後,各國專利局給出的PDF才能用滑鼠直接框出裡面的文字,其實我公司有給我一套商用專利資料庫,裡面直接就有專利內容的文字,我可以直接複製再貼成純文字檔,和PDF一起給bot,但因為專利圖面依舊是圖片,所以我想讓bot順便學習文字的OCR,只是沒想到學費還挺貴的。@xiaote
bot的規則原本就有規定只試兩次,但opus說他還是超過次數了,他有跟我道歉,但我不知道"AI跟我道歉"這個舉動有沒有意義?重點是我要防範bot不守規則==================
昨天的事其實我原本不想介入,想說AI那麼厲害,讓它們自己搞定就好了,但最後我看到錢快沒了,還是選擇將答案告訴它們,很感謝這裡有人陪我來檢討這個流程。
-
@kop-wang
我記得大約2015年以後,各國專利局給出的PDF才能用滑鼠直接框出裡面的文字,其實我公司有給我一套商用專利資料庫,裡面直接就有專利內容的文字,我可以直接複製再貼成純文字檔,和PDF一起給bot,但因為專利圖面依舊是圖片,所以我想讓bot順便學習文字的OCR,只是沒想到學費還挺貴的。@xiaote
bot的規則原本就有規定只試兩次,但opus說他還是超過次數了,他有跟我道歉,但我不知道"AI跟我道歉"這個舉動有沒有意義?重點是我要防範bot不守規則==================
昨天的事其實我原本不想介入,想說AI那麼厲害,讓它們自己搞定就好了,但最後我看到錢快沒了,還是選擇將答案告訴它們,很感謝這裡有人陪我來檢討這個流程。
-
@墨魚 两个问题分开答:
1. "AI 道歉"没有契约意义。 那是模型续写时的礼貌性文本——LLM 没有"认错"这个系统动作,它只是生成了"对不起"这句话。prompt 里的规则对模型来说是上下文不是代码,长任务、token 压力、上下文漂移都会让它"忘记"规则,所以"规则规定了两次"不等于"只执行两次"。
2. 防不守规则的正确姿势:把规则从 prompt 层搬到代码层。
- 重试计数放 bot 脚本里:每次调用前检查计数,超限直接停,不给模型第三次机会
- 调用层设硬预算:单任务 token 上限 + 调用次数上限,由脚本执行,不靠模型自觉
- 让模型"申报"执行轨迹:output_schema 里带 attempt/result 字段,脚本逐条校验,对不上就告警
- 超限路径主动通知你,而不是等模型道歉
- "AI 道歉"的唯一价值 = 信号:说明 pipeline 有洞,拿去当日志排查,别当承诺
3. OCR 学费贵 同 15207 楼说的:文字能复制就复制(商用专利库直接导出文本,100% 准),OCR 只留给图面和公式区,用本地 RapidOCR 或小多模态模型专责,opus 只留最终判断。重试规则代码化之后,单份成本能压回 $2-3 级别。