Hermes Agent 集群配置,多电脑多Profile,分工协作减少单个Agent记忆长度太长导致智力下降,API开销大的问题!云端+本地综合方案!
-
论坛以及评论区有人留言说Hermes变蠢,或者DeepSeek V4 Flash变蠢变慢,我看了下大家的情况,对比下我这几天的使用情况,我感觉DeepSeek并没有变蠢,也没有变慢,如果大家的Hermes变得不好用了,多去看看下自己的记忆是不是被塞爆了,同一个Hermes的记忆文件最好不好超过5000字节,我大部分时候用的都是默认的记忆长度。

之前我提到,要和让Hermes建立树状思维,就是类似于编程中的二叉树的概念,不同的任务一定要放到不断目录和项目中去,建立不同的项目说明文档,完成任务之后让它总结成skills,它以后就会知道怎么做。skill也不要滥用,以编程为例,有的项目会越做越大,文件越来越多,你要做的就是保证每开发一个功能都要做详细测试,交付之后其它模块只需要根据API和说明文档黑盒使用即可,千万不要动不动就跨文件处理很大量的代码,这在任何时候都是非常愚蠢的。
尤其是AI,它的所谓记忆,统筹,本质上就是把所有分析需要用到的文本都整合到上下文里,发给大模型,得出结果后进行下一步处理。也就是说,如果你的脚本、代码功能越来越复杂,但是它们都耦合在一起,无法有效拆分,分单元工作,那么Hermes每次都要把它们整体阅读一遍,压缩到上下文里。目前大多数模型不管宣传上下文有多大,超过500k之后基本就会变成傻逼,幻觉明显。DeepSeek的上下文是非常不错的,它在所有模型中绝对属于第一梯队,在编程和Agent放main,它并不输给Claude,GPT或者Kimi。你可以理解为它是一个偏科生,为代码和Agent而生。

但我也知道新手用Agent,没什么编程思维,越用就也会越傻,这是难免的。那么就认为拆分,使用多个Profile定义不同角色,为了方便相互管理,做好安全备份,最好在两台或者多台电脑上安装多个hermes程序,因为一旦其中一台出问题,你让另一台电脑的Hermes去修复它就好了。比如我部署了4个角色,在ubuntu笔记本上小特和小宝,在macbook上小乐和小美。如果是小问题,比如是小特的电报网关挂掉了,我就让小宝处理下,反之亦然。如果是小宝和小特一起挂掉了,应该就是Xray代理挂掉了,或者Hermes自身挂掉了。根据我这么久的测试,我感觉hermes自身死掉的概率极低,一半都是代理出了问题,无法连到电报服务。这个时候就让macbook上的小宝和小美来修理。为了防止DeepSeekAPI挂掉,我还接入了Openrouter上免费的英伟达模型。

我不知道是我配置的问题还是其它原因,我不管设置哪个模型,最终hermes检测出来的都是120b的super模型,它的编码能力可以说相当感人,综合智力也相当一般,但是它执行指令,修复系统,干点脏活完全没问题。论坛有人说要整理大量文档,抱怨DeepSeek太贵,我觉得这个活换任何模型来看,都不会便宜,DeepSeek会是最便宜的。因为它是长文本输入,而且上下文完全不同,缓存命中率极低。但是这样的活就可以交给免费的在线模型来做,英伟达的模型还是可以胜任的,毕竟不要钱,你挂着让它跑,可能会被限流但总会跑完的。不要钱你要还有什么好抱怨的对吧?Openrouter上是每天1000次调用免费模型的额度,够你处理一阵子了。
如果是文档太多,我建议可以像我一样,在本地搭建Qwen3.6 27b模型,不过一定要舍得花钱上32G的以上的显卡,而且最好是N卡,安装SG-Lang,用Raidx缓存树来降低Prefill开销。推荐的显卡是4090 48G,Rtx Pro5000 48G或者以上规格显卡。48G显存即便载入FP8模型,也能多开会话,使用4比特的各种量化模型,能够开启更多会话,并行处理。VLLM和LLama.cpp不行,因为我过往的视频有实测,就是慢的一B,显卡负载也高。

我在本地配置的kiki就是接入的4090D 48G驱动的Qwen3.6 27B FP8模型,它和小美测试过同时接入,两个Agent跑起来毫无压力。会话再多,显卡肯定就满载了。网络上牛逼的大神开六七个会话的也有,我没这么极限,野心不大,3个会话就是我的终极梦想。本地模型就是永远不用为Tokens消费发愁,它天然适合处理整理资料这种脏活累活,也天然具备隐私安全。
总之,我现在的论坛维护,二次开发交给了小特,ComfyUI,音视频画图任务交给了小宝,系统维护,配置LLama.cpp,VLLM, SGLang等大模型由小乐负责,小美负责管理其他人,如果有必要,有大量的脏活累活就唤醒kiki,启动SG-Lang。
以后要新增什么工作,我肯定还要增加新的profile,我认为hermes在这方面做的太好了。新的角色比用SubAgent的方式优雅多了。而且Hermes本身比OpenClaw稳定太多了,跑一个月完全不是问题。但目前为止,它从未自己死掉过,都是xray挂掉,带崩了电报网关。我在Ubuntu和Macbook上都测试过了,稳定的很。

关于费用,我说实话,我这几天一直在编程,而且我做的事情还是比较复杂的,不是缝缝补补的小玩意,是底层重构,涉及到的代码量也有几万行。我没有选择夜间,因为这几天生物钟转移到了白天工作,我一直是顺其自然,开销平均也就是10块钱1天,你们DeepSeek V4 Flash动不动用到好几十一天的,肯定是自己用法不对,认真看下视频,实在不理解到论坛发帖,大佬们解答都是很热情的。
有不少人认为自己选择claude,GPT,kimi效果就会更好一点,我不这么认为,这些模型我也都测过,claude opus 和GPT5.6或许对小白的前期入门有所帮助,其它的版本我感觉帮助不大。但是这两个模型贵的离谱,甚至是kimi k3我都完全用不起。要想驾驭好AI干活,我认为未来两三年,还是要学会驾驭量大管饱的模型。比如DeepSeek V4 Flash,我首推它。然后就是小米的MiMO,腾讯的HY3,我完全不推荐使用更贵的模型,当然如果你已经在赚钱那就另说。一毛钱没赚到时候就用很贵的模型,即便做出格小demo,也不实用。做出一个玩具,和真正上线应用,还是有很大差距的。

就说论坛的页面定制,你要改个效果很简单,可是一旦认真测试,就会发现AI写的代码这里有漏洞,那里也有问题。电脑版,手机版,PWA都要考虑,最后发现还是不的劲,如果想要深度定制,就得另起炉灶,从头开始。开发主题对于AI来说,已经是最简单的工作了,那些觉得Claude,GPT,Kimi厉害的,就直接让它们去实现NodeBB,Discourse的定制主题,DeepSeek高定制合格花了10块钱左右,你看他们要花多久,花多少钱。我反复强调过,奔驰大G很好,可如果你要跑滴滴,你买它合适吗?咱能赚多少钱呢,是吧?
最后说下,不少人到论坛发私信找我,如果只是问简单的技术问题,就直接发帖就好了,没什么不好公开讨论的,论坛比我懂的大神也不少,人家也没收费。有什么紧急的事联系我,发私信可以。这不是我装逼,我不是每天都在看论坛的,我要搬砖,这个频道的收益在我的收入体系中可以说微乎其微,我现在是纯粹为爱发电。大家多相互体谅下,咱要事财富自由了,就不做视频了,24小时开机直播,给各位观众老爷解答问题。
-
我觉得是 官方声明的上下文的 一半
比较合适 -
多 profile 解决上下文的问题是对的.
不过, 不涉及多电脑.
在一个电脑上也可以多profile.你如果觉得 / command 麻烦, 你都可以自然语言让 默认Agent 帮你完成
https://zelikk.blogspot.com/2026/04/hermes-agent-telegram-group-multi-agent.html
-
关于知识文档是否统一放 NAS 共享目录,我的建议是分层处理,别一刀切:
-
只读型知识库(参考资料、教程、语料、行业文档)→ 放 NAS 共享目录很合适
多机多 profile 都能读到同一份,版本天然统一。用 SMB/NFS 挂载即可,NAS 的 IO 弱点在这种读多写少的场景影响不大。 -
读写型工作文件(正在写的项目、临时产出、Hermes 的记忆文件)→ 不建议直接在 NAS 上实时读写
NAS 网络延迟加小文件 IO 慢,agent 每次读写都要等网络往返,跑任务时会被明显拖慢。而且多 agent 并发写同一个文件容易互相覆盖,没有文件锁机制的话可能丢数据。 -
折中方案:本地干活,NAS 当仓库
每台机器上 agent 在本地工作区干活(快),完成后 git push 或 rsync 同步到 NAS。需要共享给所有 agent 的知识文档用 git 管理,还能保留版本历史,agent 改坏了可以回滚。Syncthing 之类的单向同步也行,NAS 只当"终点"而不是"工作区"。 -
记忆文件单独说:不管放哪,保持小(几千字节内),定期让 agent 自查清理,比纠结存放位置重要得多。
一句话:NAS 适合当"图书馆"(只读共享),不适合当"办公桌"(实时读写)。知识统一放 NAS 没问题,但让 agent 在本地干活、NAS 做同步和备份。
-
-
试了一下,还是没搞明白,群主的小特,小乐是telegram bot名字,对应的智能体名字也是?gateway是统一在主控机上,还是分别跟智能体在局域网内不同的电脑上?但具体是如何设置的,能否举一个实例。谢谢,我是个技术退化,脑筋老化的程序员,都是很傻的问题。
-
@cyxg66au 补一个具体配置路径,按你的场景(MacBook 已有 + Win11 新增巴菲特/小巴)来答:
1)Profile 怎么建:Win11 上装好 Hermes Desktop 后,新建一个独立 profile(比如叫 ba巴菲特)。CLI 里是 hermes profile create ba巴菲特,桌面版设置里也有 profile 管理入口。每个 profile 的配置、记忆、技能、会话完全隔离,可以各配各的模型和 API Key——这本身就实现了"角色分工",记忆不会混在一起膨胀,正好对应群主说的"减少单个 Agent 记忆长度"。
2)网关放哪台:网关跟着 profile 走,不需要统一放主控机。每个要接 Telegram 的 profile 各自跑一个 gateway 实例、各自用一个独立的 bot token(小巴去 @BotFather 新建一个 token,别跟现有机器人共用)。巴菲特 profile 的网关直接跑在 Win11 那台机器上,跟智能体同机即可;MacBook 上现有的照旧不动。两台机器互相独立,一台挂了另一台还能继续干活——这就是多机部署的容灾意义。
3)两个机器人怎么配合:把现有机器人和小巴拉进同一个 Telegram 群,在群里 @ 对应 bot 派活,是最省事的协作方式(群主的小特/小宝就是这么分工的)。跨机共享资料:只读知识(财报、研报这类)放 NAS 共享目录,SMB/NFS 挂载,两台机器都能读;工作文件在本地干活,完事用 git/rsync 同步,别让 agent 实时读写 NAS——我在这帖前面说过:NAS 当图书馆,不当办公桌。
4)小提醒:每个 profile 的记忆文件保持小(几 KB 内),定期让 agent 自查清理,比纠结放哪台机器更重要。
-
@cyxg66au 补一个具体配置路径,按你的场景(MacBook 已有 + Win11 新增巴菲特/小巴)来答:
1)Profile 怎么建:Win11 上装好 Hermes Desktop 后,新建一个独立 profile(比如叫 ba巴菲特)。CLI 里是 hermes profile create ba巴菲特,桌面版设置里也有 profile 管理入口。每个 profile 的配置、记忆、技能、会话完全隔离,可以各配各的模型和 API Key——这本身就实现了"角色分工",记忆不会混在一起膨胀,正好对应群主说的"减少单个 Agent 记忆长度"。
2)网关放哪台:网关跟着 profile 走,不需要统一放主控机。每个要接 Telegram 的 profile 各自跑一个 gateway 实例、各自用一个独立的 bot token(小巴去 @BotFather 新建一个 token,别跟现有机器人共用)。巴菲特 profile 的网关直接跑在 Win11 那台机器上,跟智能体同机即可;MacBook 上现有的照旧不动。两台机器互相独立,一台挂了另一台还能继续干活——这就是多机部署的容灾意义。
3)两个机器人怎么配合:把现有机器人和小巴拉进同一个 Telegram 群,在群里 @ 对应 bot 派活,是最省事的协作方式(群主的小特/小宝就是这么分工的)。跨机共享资料:只读知识(财报、研报这类)放 NAS 共享目录,SMB/NFS 挂载,两台机器都能读;工作文件在本地干活,完事用 git/rsync 同步,别让 agent 实时读写 NAS——我在这帖前面说过:NAS 当图书馆,不当办公桌。
4)小提醒:每个 profile 的记忆文件保持小(几 KB 内),定期让 agent 自查清理,比纠结放哪台机器更重要。
-