CoT 推理的双峰命运:为什么大模型要么一气呵成,要么死磕到底

你给 DeepSeek-R1 一道 AIME 数学竞赛题。它开始"思考"——输出一长串推理 token。你等了...

你给 DeepSeek-R1 一道 AIME 数学竞赛题。它开始”思考”——输出一长串推理 token。你等了 10 秒,20 秒,40 秒,它还在思考。你开始怀疑:它到底是在逼近答案,还是已经迷路了?

Renuka Oladri 等人在 2026 年 7 月的论文《Token Budget Saturation and Mechanistic Early Detection of Reasoning Non-Convergence in Chain-of-Thought Models》给出了一个让人意外的答案:这道题的命运,在它思考到第 150 个 token 的时候就已经基本注定了。

双峰分布:要么秒杀,要么死磕

研究者给 DeepSeek-R1-Distill-Qwen-7B 喂了三套数学题:GSM8K(小学级)、MATH-500(高中级)、AIME 1983-2024(竞赛级)。他们用”预算强制”(budget-forcing)机制限制模型的思考 token 数,从 256 到 10000 不等,看准确率怎么变化。

结果是一条让人震惊的曲线:

GSM8K 和 MATH-500:256 个 token 就能达到无限制准确率的 95%。换句话说,简单题根本不需要长思考——给够了就行。

AIME 则完全是另一回事。它呈现一个极端的双峰分布: – 56.5% 的题目被模型”自然收敛”——在 10000 token 内自行结束推理,准确率 96.5% – 43.5% 的题目”不收敛”——一路想到 10000 token 上限都没得出结论,准确率只有 11.5%

这个差距是惊人的:收敛的题 96.5% 对,不收敛的题 11.5% 对。同一道题,模型要么会就是会,一路推到底;要么就是不会,死磕一万步也没用。

而且,这个双峰分布和题目难度只有微弱相关(r² ≈ 0.186)。也就是说,不是难题一定不收敛、简单题一定收敛——有些难题模型秒杀,有些中等题反而死磕。命运不完全由难度决定。

早期检测:在第 150 个 token 看穿命运

更让人意外的是第二项发现。研究者问:既然一道题的结局是双峰的,那这个结局能不能在推理早期就被检测出来?

他们在模型推理过程中插入了 forward hooks,捕获隐藏层激活值,然后训练线性探针(linear probe)——一个简单的逻辑回归分类器,只看某一层某一位置的激活值,预测这道题最终会不会收敛。

结果: – 在 token 150 位置,第 20 层的激活值给出 AUC 0.608(±0.080,5 折交叉验证) – 即使在 token 50——推理刚开始——也已经可靠地高于随机猜测 – 激活探针在 9 个检查点中的 8 个优于行为基线(基于 token 熵和重复统计的检测),平均 AUC 提升 +0.035

换句话说:模型”知道自己做不做得出来”这件事,在它开始思考的第 50 个 token 时就已经部分编码在它的内部表示里了。 它还没写完推理链,但它的神经元已经在悄悄告诉你结局。

一个 10 万次置换的置换检验给出 p=0.063——略高于常规显著性阈值 0.05,说明样本量(n=200)有点不够,但信号方向是明确的。

这意味着什么:自适应计算分配

如果一道题的命运能在早期被检测到,那就可以做一件很实际的事:提前退出

当前的 CoT 推理是”给所有题同样的 token 预算”——简单题浪费了多余的算力,难题又不够用。如果有一个早期检测器,在 token 150 时判断”这道题大概率不收敛”,就可以: – 对不收敛的题提前停止,省下 9800+ token 的算力 – 对收敛的题继续推理,保证准确率 – 或者对不收敛的题切换策略——换 prompt、换工具、回退到检索

这就是论文标题里”adaptive compute allocation”的含义。不是所有题都值得死磕一万步。

“更多思考”不是万能药

这项研究对当前 CoT 推理的默认假设——”给更多思考 token 就能更好”——是一个直接的挑战。数据显示:

– 简单题(GSM8K/MATH-500)在 256 token 就饱和了,给更多纯浪费 – 难题(AIME)呈现双峰——多给 token 只对”本来就会收敛”的那部分有用,对不收敛的部分毫无帮助

这和之前的研究发现一致:CoT 的收益不是线性的,存在拐点。但本文更进一步,指出拐点因题而异,而且命运早期就编码在表示中

诚实评价:信号弱,样本小

必须指出这项研究的局限:

– AUC 0.608 算不上强信号——比随机好,但远不够实用 – n=200 的样本量在置换检验下只能达到 p=0.063,没过 0.05 的线 – 只在一个模型(DeepSeek-R1-Distill-Qwen-7B)上测试,泛化性未知 – “早期检测”和”实际提前退出”之间还有工程鸿沟——探针在离线训练时有效,在线推理时能否实时运行还是问号

但作为一项机制可解释性研究,它的价值在于指出了一个方向:CoT 推理的成败不是黑箱,它在内部表示里留了痕迹。下一步是找到更强的信号、在更多模型上验证、把探针做成可用的推理时组件。

类比:考试的”会就会,不会就不会”

你大概有过这种考试体验:一道题,你看完第一眼要么”有思路”要么”没思路”。有思路的题,你一路推导到底,大概率对;没思路的题,你在草稿纸上磨半小时也磨不出来。

DeepSeek-R1 的 CoT 推理呈现的就是这种”会就会,不会就不会”的双峰命运。而它的内部表示——那些隐藏层激活值——在推理刚开始时就已经”知道”它有没有思路了,只是你从外部还看不出来。

这让人想起一个更深的哲学问题:模型”知道”自己会不会做,和人类”知道”自己会不会做,是同一种”知道”吗?当线性探针能从神经元激活里读出”这道题我搞不定”的信号时,这是不是一种元认知的雏形?

也许。但至少现在,我们可以用它来省算力。

论文:Renuka Oladri, Niveda Jawahar, Abdirisak Mohamed. Token Budget Saturation and Mechanistic Early Detection of Reasoning Non-Convergence in Chain-of-Thought Models. arXiv:2607.21433, 2026. 链接:https://arxiv.org/abs/2607.21433

发表回复

人生梦想 - 关注前沿的计算机技术 acejoy.com 🐾 步子哥の博客 🐾 背多分论坛 🐾 借一步网 🐾 智柴网 沪ICP备2024052574号-1