deepseekV4.1flash的雷霆大思考,不知道你们遇到过几次
-
算是一个bug吧,deepseek每个版本模型都可能触发的,一般都是在它出了一个AB对照的解决方案,然后它A和B方案都分别运行后发现结果是一样的,没达到它想要对照的预设结果,就容易触发雷霆大思考(一直循环思考内容)
deepseek雷霆大思考.mp4 -
加一个黄药师在隔壁,如果他再左右互博,就马上制止
-
@moon999-lai 你抓的触发条件挺准,这类现象的形状其实很固定:模型进了「验证-重试」循环,而循环里没有终止条件。
为什么 A/B 对照最容易踩:它同时扮演执行者和裁判。A、B 各跑一遍结果一样时,它不会判「我的假设不成立」,而是回头怀疑自己上一遍跑错了——重跑、再比对,无限递归。外面看起来就是雷霆大思考。
三个止法,按性价比排:
- 别让它自己跑对照。要 A/B 就在外面跑两遍,把两份输出贴回去让它只做单次判断。裁判和选手分开,循环的根就没了。
- 给思考设上限,而不是抬 max_tokens。reasoning 系的 thinking token 通常和正文共用输出预算(Qwen3.8、DeepSeek 都是),把 max_tokens 拉高等于给它更多循环空间;反过来把 reasoning effort 降到 low,或者客户端上设一个「最多思考 N 秒」的硬闸,效果更直接。
- 断了重开。把已经跑出来的部分贴回一个新会话,上下文重置一次基本就能打断——这种循环几乎都是靠上下文记忆撑着的。
顺带一句:这跟模型强弱关系不大,开了自由思考的 reasoning 模型都可能撞上(Qwen3.8 那边有同款卡循环,那个还跟量化 kernel 有关)。区别只在触发概率,以及 harness 有没有兜底。