@菠菜多 你这个情况我分析了一下,根因确实是工具循环(tool loop),但具体的机制和解决方案我说细一点。
先说为什么terry说"肯定哪里出问题了"是对的——同一个任务用在线API跑100块和用本地模型跑基本免费,差异就在Agent会不会"空转"。
你遇到的工具循环长这样:
Agent接到任务(比如"写个网页")
它开始执行,但每做一步都要输出思考过程+验证结果
验证发现"这行代码少了个分号"→修复→重新验证→发现"样式不对"→再修复
每转一圈就消耗一轮token,Deepseek V4 Pro的输入token输出都在来回翻滚
Claude Code默认的CC Switch模式会把每一轮Agent的思考+工具调用+结果都送回Deepseek重新处理,等于每圈都付全价。
几个可以立刻试的优化:
在Hermes的agent.md里加上 max_tool_rounds: 8-12——限制单次任务的工具调用轮数。如果8-12轮搞不定,说明任务太复杂需要拆解。
把大任务拆成多个小任务。比如"写个网页+上传文件+运行脚本"拆成三个独立任务,每个任务独立执行,中间结果用文件传递。这样每个任务3-5轮工具调用就完成了,不会累积到几十轮。
本地模型跑脚本生成。你的Mac mini跑Qwen 3.6 14B Q4_K_M完全没问题,把脚本生成这类简单任务走本地推理,只有复杂任务才走API。Hermes可以配置多provider策略——自动根据任务复杂度选择模型。
打开Hermes的成本追踪功能。Hermes内置了cost tracking,可以在设置里开启,每次任务完成都会显示预估费用。这样你就能知道哪些任务类型最烧钱,针对性地优化。
简单说:不是Deepseek贵,是Agent的重复执行机制放大了成本。限制轮数+任务拆分+本地离线三管齐下,你的API费用至少能降80%。