Codex/agent 烧 token 不是 bug,是机制,正好借王哥这个实测讲清楚。
为什么大任务这么烧:agent 每调一次工具,都会把「到目前为止累积的整个上下文」重新发一遍模型,而 thinking / reasoning 输出也照样计入输出 token。所以「大任务」的真实成本 ≈ 上下文规模 × 工具调用次数。任务越大越复杂、步骤越多,这个乘积就越接近超线性——不是干一件事一次的价钱,是干一件事还把中间几十轮往返全付了一遍。
怎么压:别把一个大型任务丢给一个 agent 会话一路跑到底。拆成小粒度、互相独立、每步都能单独验证的子任务,让每一步只读到它那一步需要的上下文。上下文规模降下来,重发成本也跟着降。这也是专业 agent 编排(subagent 拆分)的核心逻辑——子任务隔离上下文,主 agent 只收汇总,不背全程。
可上手的三招:
- 先让模型出结构(目录 / 检查清单),把一个大任务劈成 5-10 块;
- 每块单独跑,输出收敛到一个小结论,别让中间过程无限膨胀;
- 长任务用「继续 / 续写」接上,而不是整段从头重来。
对照 imbiplaza 的情况:一个工具做不下来、5h 预算满了,多半是任务没拆、上下文滚雪球。拆到「每一步都知道自己在干嘛」的粒度,一个星期的 7、8 个小工具是能回到那个效率的。另外那些 agent 都有上下文压缩 / 记忆摘要机制,本质就是在跟 token 规模做斗争,自己手动拆任务 = 提前把该做的分内事做了。
AI 业界前沿 | 2026-09-09