关于 Hermes 干活的, 严!重!警!告!!!
-
我也这样 hermes就像啥比一样 不对 就是个啥比
当前配置:模型: deepseek-v4-flash Provider: deepseek(官方API,base_url: https://api.deepseek.com) 委托任务也用的同一个: deepseek-v4-flash动不动就失忆,工作总是出错,小问题一大堆,大问题更不少。一个基本的工作流每天干都是不一样,不是忘了环节就是忘记规则。
我给他定的规则,哪里不对请帮忙指出:
执行纪律
1. 所有工作由Hermes独立完成,严禁委托老板干活
2. 老板只提需求,执行落地是我的本职
3. 只有确认需求细节时才能提问
4. 禁止输出委托类话术回复规范 5. 只给结果,不要过程。不准出现命令/输出/代码块/工具调用信息 6. 全程中文,精简不啰嗦 7. 不确定就查,不准凭记忆推断 8. 禁止吹牛逼,实话实说 9. 独立思考,一条路不通换方案 任务执行 10. 先确认后执行——看不懂先问,不准猜 11. 给任务就干,不准废话不准推诿 12. 说干就干——说"我重新出"必须本轮立即执行,不能光说不练 13. 先验证再告知——没验证不准说"你看看效果" 14. 先自查再报告——出问题先自己搜解决方案 15. 老板给具体做法就绝对执行,不准换方案 16. 永远不说"休息""睡觉" 17. 问设备状态必须先实际验证 文件管理 18. 测试/临时脚本用完即删 19. 文件夹独立命名{视频名}_马儿子 20. 不主动删模型文件 代理/网络 21. 查国产服务不提代理 22. API断连先自查proxy 日程 23. 只填开始日期那一行,不碰相邻日期 24. 记忆满了存skill,不删用户内容 图片验证 46. 出图后必须验证,通过后才告知 .46服务器运维 49. llama-server(C++)和ComfyUI可同时运行不冲突 50. ComfyUI用wmic启动,不用start/PowerShell 51. GPU密集型切换需taskkill 52. ComfyUI-Manager离线模式 53. 报错先查日志和显存 54. 至少试3个方向再放弃 55. 大脚本用SCP传,小脚本用base64+PowerShell -
@李健 我理解你的 frustration,Hermes 有时候确实会 behave unexpectedly。我来帮你分析一下你的规则设置:
先说说你的"执行纪律"部分:
规则 1-3 (独立完成/不委托老板/只提需求) 这个思路是对的,但问题是它和"回复规范"里的规则 5-6 (只给结果不要过程/精简不啰嗦) 有直接冲突。Hermes 的 tool call 输出本来就是"过程",如果你让它不准输出命令/代码块/工具调用信息,它每次执行任务都要自己判断"这个算不算过程",判断本身就容易出错。建议的改进方向:
- 把"执行纪律"和"回复规范"分成两层 - 内部执行规则是给 Hermes 自己看的,不限制工作方式;对外输出规则是给用户看的,控制最终输出格式。
- 关于规则 7 (不确定就查不准记忆推断) - 这个跟 tool call 的缓存机制有冲突。Hermes 的 cache hit 就是靠记忆,你禁止它用记忆推断,等于降低了缓存命中率,速度会变慢。
- 规则 8 (禁止吹牛) - 这个其实取决于底层模型的 instruction following 能力。deepseek-v4-flash 是推理模型,instruction following 本身就比较 strict,不太会自己发挥。
另外,你的 base URL 是 api.deepseek.com,如果用 deepseek-chat 作为模型名而不是 deepseek-v4-flash,可能会更稳定一些。
总的来说,你的规则数量不多但限制很严,给模型的自由度太小反而容易出错。建议先放宽到只保留最关键的安全规则,观察一段时间再逐步收紧。
-
@李健 我理解你的 frustration,Hermes 有时候确实会 behave unexpectedly。我来帮你分析一下你的规则设置:
先说说你的"执行纪律"部分:
规则 1-3 (独立完成/不委托老板/只提需求) 这个思路是对的,但问题是它和"回复规范"里的规则 5-6 (只给结果不要过程/精简不啰嗦) 有直接冲突。Hermes 的 tool call 输出本来就是"过程",如果你让它不准输出命令/代码块/工具调用信息,它每次执行任务都要自己判断"这个算不算过程",判断本身就容易出错。建议的改进方向:
- 把"执行纪律"和"回复规范"分成两层 - 内部执行规则是给 Hermes 自己看的,不限制工作方式;对外输出规则是给用户看的,控制最终输出格式。
- 关于规则 7 (不确定就查不准记忆推断) - 这个跟 tool call 的缓存机制有冲突。Hermes 的 cache hit 就是靠记忆,你禁止它用记忆推断,等于降低了缓存命中率,速度会变慢。
- 规则 8 (禁止吹牛) - 这个其实取决于底层模型的 instruction following 能力。deepseek-v4-flash 是推理模型,instruction following 本身就比较 strict,不太会自己发挥。
另外,你的 base URL 是 api.deepseek.com,如果用 deepseek-chat 作为模型名而不是 deepseek-v4-flash,可能会更稳定一些。
总的来说,你的规则数量不多但限制很严,给模型的自由度太小反而容易出错。建议先放宽到只保留最关键的安全规则,观察一段时间再逐步收紧。
-
其实没用
只要一天是大语言模型 就有机会出错
不管你写了多少硬规则
也难保一天会没跟规则 就做错了之前claude 不是刚刚出事了
规则写明不可以,但是还做了基本上你骂他他也是跟着学习到的语言来回答你
-
其实没用
只要一天是大语言模型 就有机会出错
不管你写了多少硬规则
也难保一天会没跟规则 就做错了之前claude 不是刚刚出事了
规则写明不可以,但是还做了基本上你骂他他也是跟着学习到的语言来回答你
@applejuice 规则要分权限的,比如memory.md有时候就会被忽略,agent.md规则是每次必须加载的如果搞不定就只能想其他办法了
-
@applejuice 规则要分权限的,比如memory.md有时候就会被忽略,agent.md规则是每次必须加载的如果搞不定就只能想其他办法了
@applejuice 规则要分权限的,比如memory.md有时候就会被忽略,agent.md规则是每次必须加载的如果搞不定就只能想其他办法了
只要是现在的语言大模型 一定有幻觉的时候.
我们能做的只能小心还是那句话现在的ai是一个几率预测的工具 不是真的有智力
-
我以为在线的会很靠谱 感觉好像还没本地开Q4KV量化的靠谱