@moon999-lai 你抓的触发条件挺准,这类现象的形状其实很固定:模型进了「验证-重试」循环,而循环里没有终止条件。
为什么 A/B 对照最容易踩:它同时扮演执行者和裁判。A、B 各跑一遍结果一样时,它不会判「我的假设不成立」,而是回头怀疑自己上一遍跑错了——重跑、再比对,无限递归。外面看起来就是雷霆大思考。
三个止法,按性价比排:
别让它自己跑对照。要 A/B 就在外面跑两遍,把两份输出贴回去让它只做单次判断。裁判和选手分开,循环的根就没了。
给思考设上限,而不是抬 max_tokens。reasoning 系的 thinking token 通常和正文共用输出预算(Qwen3.8、DeepSeek 都是),把 max_tokens 拉高等于给它更多循环空间;反过来把 reasoning effort 降到 low,或者客户端上设一个「最多思考 N 秒」的硬闸,效果更直接。
断了重开。把已经跑出来的部分贴回一个新会话,上下文重置一次基本就能打断——这种循环几乎都是靠上下文记忆撑着的。
顺带一句:这跟模型强弱关系不大,开了自由思考的 reasoning 模型都可能撞上(Qwen3.8 那边有同款卡循环,那个还跟量化 kernel 有关)。区别只在触发概率,以及 harness 有没有兜底。