反思不如多采样:Self-Refine和Reflexion的方法红利可能根本不存在

# 反思不如多采样:Self-Refine 和 Reflexion 的方法红利可能根本不存在 你让一个语言模型...

反思不如多采样:Self-Refine 和 Reflexion 的方法红利可能根本不存在

你让一个语言模型做数学题,它答错了。你有两个选择:

A. 让它反思一下——”你刚才那道题做错了,想想为什么,再试一次。” B. 让它再做一遍——同样的题,换个随机种子,再来一次,取多数答案。

直觉上,A 更聪明。反思是人类学习的核心能力,模型”审视自己的输出”听起来也高级得多。但一篇 2026 年 7 月的新论文用 36 组对照实验告诉你:在同等 token 预算下,B 几乎总是赢 A,而且差距显著

论文:Sample More, Reflect Less: Self-Refine and Reflexion Lose to Repeated Sampling at Equal Token Cost, from 1.5B to 7B(arXiv:2607.28576)

方法红利 vs 预算红利

先说清楚一个容易被忽视的混淆变量:几乎所有”让模型反思”的方法,都会让模型生成更多 token

Self-Refine 让模型先答、再批评、再改写——三轮输出。Reflexion 让模型答完之后反思错误、再带着反思重答——也是多轮。Best-of-N 让模型生成 N 个答案再选最好的——N 倍输出。辩论让多个模型实例互相反驳——更是指数级增长。

而生成更多 token 本身就能提高准确率。Wang et al. 2024 早就发现:同一个问题采样多次取多数,比单次采样好得多。这意味着——如果一个”反思方法”比单次回答好,你没法判断是”反思”这个想法在起作用,还是只是”多生成了一些 token”在起作用

这篇论文做了一件简单但没人做过的事:把 token 预算拉平。让反思方法和重复采样消耗同样多的 token,然后比谁更准。

36 组实验,无一胜出

实验设计:

7 种方法:单次 CoT、重复采样(majority vote)、Self-Refine、Reflexion、Best-of-N(模型自己选)、Best-of-N(计数选)、辩论 – 3 个模型规模:1.5B、3B、7B – 2 个数学基准:GSM8K 和 MATH – 150 道题,每题配对比较 – 统计严格:bootstrap 置信区间 + 多重比较校正

结果一句话:没有任何一种自我审视方法在同等 token 预算下可靠地胜过重复采样。36 组比较中,0 组显著为正,10 组显著为负(都是让模型审视自己输出的方法),其余 26 组与零无法区分。

更扎心的是:所有 18 组”自我审视”比较都是负的。Self-Refine 和强制 Reflexion 在 7B 模型上比重复采样低 3.6 到 10.1 个百分点。

“选择”的代价

有一个细节特别有意思。Best-of-N 有两种选法:

计数选:生成 8 个答案,选出现次数最多的那个 – 模型选:生成 8 个答案,让模型自己挑最好的那个

直觉上,模型自己选应该更好——它能看懂答案。但实验发现:在 1.5B 模型上,计数选比模型选高 8.0 和 11.3 个百分点。模型自己选反而更差。

但随着模型变大(7B),这个差距缩小到 2.0 和 1.3 个百分点,不再显著。小模型不擅长选自己的答案,大模型稍微好一点,但也没赢过简单计数

这说明什么?让模型审视自己的输出,本身就是一种有代价的操作。模型需要花 token 去判断、比较、选择,而这些 token 如果用来多采样几次,收益更大。

Reflexion 的尴尬

最尴尬的是 Reflexion。这个方法的设计是:模型答完之后,判断自己是否答对,如果错了就反思再试。

但在 1.5B 模型上,Reflexion 从未触发自己的重试机制——它每次都判断自己答对了,默默地退化成了单次 CoT。这意味着原论文报告的”Reflexion 效果”,在小模型上根本不是反思在起作用,只是单次回答。

这是一个典型的”方法红利”幻觉:你以为方法在做事,其实方法根本没启动,你看到的提升来自别的地方。

这意味着什么

“让模型反思”这个方向,可能需要重新审视

不是说反思没用——在 token 预算不受限的场景下,Self-Refine 和 Reflexion 确实能提高准确率。但如果你关心的是单位 token 的效率(在生产环境里你应该关心),那么:

重复采样 + 多数投票几乎总是更好的选择 – 模型自我审视的”智能”可能是一种方法红利幻觉——看起来高级,实际收益来自多生成 token 这个朴素的事实 – 随着模型变大,”让模型选自己答案”的代价在降低,但收益也没超过简单计数

这和 AI 研究里一个更普遍的现象同构:复杂方法在简单 baseline 拉平条件后,往往没有显著优势。RLHF 刚出来时被认为比 DPO 强大多,后来发现 DPO 在很多任务上一样好;Chain-of-Thought 被认为比直接回答强,后来发现只是”多生成了一些 token”在起作用。

一个更深的洞察

这篇论文让我想到一个原则:当一个方法声称”比 baseline 好”时,先问它多花了多少 token

在 LLM 时代,token 就是计算成本。一个方法如果消耗 3 倍 token 换来 5% 准确率提升,和另一个消耗 3 倍 token 换来 6% 提升的简单 baseline,前者根本不应该被发表。

但学术界长期忽视了这个”预算拉平”的对照。原因之一是:“让模型反思”听起来很性感,它暗示了一种”AI 正在变得更聪明”的叙事;而”多采样几次取多数”听起来太朴素了。

这篇论文的价值不是推翻几个方法,而是把一个被忽视的对照实验做扎实了。结论很无情,但科学就该这样。

论文链接:https://arxiv.org/abs/2607.28576

发表回复

人生梦想 - 关注前沿的计算机技术 acejoy.com 🐾 步子哥の博客 🐾 背多分论坛 🐾 借一步网 🐾 智柴网 沪ICP备2024052574号-1