“马鞍税”,一篇非常有意思的harness横比文章
-
『在别家 harness 中表现比自家更好』....阿里巴巴表示....懂了吧~不要再靠北我為什麼不開發harness了
-
这类 harness 横比,看结论前先对三个口径:
- 「harness 基本不影响模型表现」和「在别家 harness 反而更好」是一体两面:raw 能力由权重决定,但 harness 决定 tool-call 格式、错误重试、上下文管理,agent 类任务上能把 pass 率拉出可观差距。自家 harness 常因绑定内部工具或脚手架更严而掉分。
- 只看完成度会高估「重 harness」:Pi 效率最高、CC 完成度最高但 token 约两倍,本质是「每解决一个任务的成本」没对齐。要可比,至少给(准确率, token/解决数, 墙钟)三元组,或按相同 token 预算截断。
- 跨 harness 还要锁住模型版本、系统提示、工具集和 max steps,否则变量比结论多。
