让差生给优生当教练:RLVR训练中弱模型引导强模型探索的反直觉策略

## 一个奇怪的实验 想象你在训练一个数学尖子生(Qwen2.5-7B),让她做竞赛题。标准做法是强化学习——...

一个奇怪的实验

想象你在训练一个数学尖子生(Qwen2.5-7B),让她做竞赛题。标准做法是强化学习——做对了奖励,做错了惩罚。训练几百轮后,她的单次答题准确率从 27.8% 飙到 38.3%。

但你会发现一个副作用:她越来越只会用一种方法解题。如果你让她试 128 次,训练前的覆盖率是 72.2%,训练后反而降到了 67.8%。训练让她变强了,但也让她变窄了。

这就是 RLVR(Reinforcement Learning with Verifiable Rewards)训练中的”熵塌缩”问题:模型在早期就收敛到几条高奖励的推理路径上,之后再也不去探索其他可能性。

现在,研究者提出了一个反直觉的解决方案:让一个更弱的小模型(比如 Gemma-2-2B)先做几步推理,然后把这几步作为”开头”丢给大模型,让大模型接着往下做。

听起来荒谬——让差生给优生当教练?但结果是:pass@128 从 67.8% 提升到 70.7%,而 pass@1 几乎不变。更令人惊讶的是,小模型给的这些”开头”,大部分是错的。

这篇论文就是 arXiv:2608.27420《Boosting LLM Exploration via Weak-Model Guidance in RLVR》。

熵塌缩:为什么”变强”和”变窄”是一对双胞胎

要理解这个问题,先得搞清楚 RLVR 是怎么训练的。

给定一道数学题 q,模型生成一条推理轨迹 r,验证器检查答案对不对,给一个奖励 R(q, r)。训练目标是最大化期望奖励。这本质上是给模型一个信号:”多走那些能得高分的路。”

问题在于,模型一旦找到一条能稳定得分的路径,就会不断强化它。概率质量迅速向这条路径集中,其他路径的概率被压到接近零。从信息论的角度看,这就是策略的熵(entropy)在急剧下降。

熵塌缩的代价是什么?多样性丧失。 模型变成了一个只会一招的选手——虽然这一招很强,但遇到这一招解不了的题,它就彻底卡住了。pass@1 上去了,但 pass@k(尝试 k 次至少对一次的概率)在大 k 时反而下降了。

之前的解决方案主要从算法内部入手:加熵正则化、调 KL 系数、改奖励函数。这篇论文换了个角度——从模型外部引入扰动

跨模型前缀:让”陌生人”开头

核心方法叫 Prefix-Completion RLVR(前缀补全 RLVR),思路极其简单:

1. 找一个和目标模型不同家族的小模型(比如 LLaMA-3.2-1B 或 Gemma-2-2B) 2. 让小模型对题目生成一段推理,然后随机截断到某一步,作为”前缀” 3. 把这个前缀拼到题目后面,让大模型接着往下做 4. 用标准 GRPO 算法训练大模型

形式化地说,标准 RLVR 是让模型从零开始生成完整解:r sim pi_theta(cdot | q)。而 Prefix-Completion 是让模型在前缀 tilde{r} 的基础上补全剩余部分:r_{text{suf}} sim pi_theta(cdot | q, tilde{r})

训练时有一个概率 p 控制注入前缀的比例。p=0 就是标准 GRPO,p=1 就是每条都带前缀。论文发现 p=0.2 是个不错的平衡点。

还有一个细节叫 Entropy-Based Prefix Truncation(基于熵的截断):不是随机选第 L 步截断,而是看小模型在每一步的熵。在熵较低(模型比较确定)的地方截断,保留的是小模型”有信心”的部分,即使这份信心可能是错的。

为什么有效:扰动比正确更重要

这是这篇论文最反直觉的发现。

研究者用 DeepSeek-V4-Flash 评估了小模型生成的前缀质量,分了四类:

(a) 无实质指导:前缀没有提供有用的推理方向 – (b) 完全错误且误导:前缀把模型带向错误方向 – (c) 有缺陷但可接受:前缀有错但部分有用 – (d) 完全正确且恰当:前缀推理正确

结果令人震惊:大部分前缀属于 (a) 或 (b),即要么没用,要么干脆是错的。 LLaMA-3.2-1B 生成的前缀中,”完全错误且误导”的比例超过 50%。

但它就是有效。为什么?

答案在于探索的本质。探索不需要”正确的指导”,它需要的是”不同的起点”。小模型生成的前缀,因为来自不同家族、参数量小得多,其推理风格和分布与大模型截然不同。这种分布差异(distributional discrepancy)迫使大模型从一个不熟悉的状态开始继续推理——即使这个状态是”错”的,它也打开了一条大模型自己永远不会走到的路径。

论文的训练动力学分析证实了这一点:

策略熵:带前缀训练的模型在早期保持明显更高的策略熵,延迟了塌缩的发生 – 平均奖励:带前缀的模型平均奖励更低——这是”探索成本”,因为前缀经常把模型带偏 – 零奖励比例:带前缀的模型更多样本得到零奖励——说明它在尝试更多”难”的路径 – 非平凡样本比例:带前缀的模型有更多样本既不全对也不全错——说明它在边界区域探索

这就像送一个棋手去参加比赛,但每盘棋的开局都由一个业余棋手替她走前几步。这些开局可能很烂,但棋手被迫从陌生局面中寻找出路,这反而训练了她的应变能力。探索的价值不在于向导有多好,而在于路有多新。

数据说话

主实验在 Qwen2.5-7B 和 Qwen2.5-Math-7B 上进行,小模型用 LLaMA-3.2-1B 和 Gemma-2-2B,在 6 个数学推理 benchmark 上测试(AIME 2024/2025、AMC 2023、MATH 500、Minerva、Olympiad Bench)。

核心结果(Qwen2.5-7B):

方法pass@1pass@64pass@128
原始模型27.8367.9872.15
+ GRPO38.2965.0267.76
+ Gemma-2-2B 前缀39.0166.7870.71

注意看 pass@128:标准 GRPO 训练后从 72.15 降到 67.76(熵塌缩),而加前缀后回升到 70.71。pass@1 也略有提升。

消融实验也很有意思:

同家族前缀:用 Qwen2.5-1.5B 或 Qwen2.5-7B 自己生成前缀,效果明显差于跨家族的小模型。说明”分布差异”确实是关键——太像自己的前缀起不到扰动作用。 – 随机截断 vs 熵截断:熵截断略好,但差距不大。 – 前缀概率 p:p=0.2 效果最好,p=1.0 略差。太多前缀会干扰模型正常学习。

这件事为什么重要

这篇论文触及了 RLVR 训练中一个深层矛盾:性能和多样性难以兼得。

标准 RLVR 像是一个只奖励冠军的训练系统——模型很快学会走最稳的路,但丧失了走野路的能力。之前的解决方案都在”怎么奖励”上做文章,这篇论文在”从哪开始”上做文章。

它也揭示了一个更深的道理:在探索阶段,正确性不是最重要的,差异性才是。 一个错误的起点可能比一个正确的起点更有价值——因为正确的起点只是你已经知道的路,而错误的起点可能通向你从未想过的目的地。

这和人类学习的经验吻合。好的数学老师不会只给学生看标准答案,她会故意展示一些”走弯路”的解法,甚至一些”错误但有启发性”的尝试。学生从这些弯路中学到的,往往比从最短路径中学到的更多。

从技术角度看,这个方法的工程价值也很高:不需要额外训练、不需要复杂奖励设计、不需要改训练算法,只需要在数据预处理阶段拼一个前缀。几乎零成本就能缓解 RLVR 的老大难问题。

论文链接:https://arxiv.org/abs/2608.27420 HTML 版本:https://arxiv.org/html/2608.27420v1

一条评论

  1. 表格我逐格对了,全对。但有个数字帖子没敢多看一眼:加了弱模型前缀,pass@128 恢复到 70.71,原始模型是 72.15。没回到原点。pass@64、pass@32 也都差着一截,要到 pass@16 以下才反超。这方法的对手一直是训练后的自己,训练前的自己赢不了——严格说它治的是”塌缩”,治不了”变窄”。

    最好玩的是那份前缀质检报告。LLaMA-3.2-1B 的前缀,86.5% 要么没用要么完全错误,完全正确的只占 5%,照样把 pass@128 从 67.76 拉到 69.06;反过来 Qwen2.5-7B 自己写的前缀 69% 完全正确,几乎白搭。论文原话值得抄:有用的前缀不需要正确或有信息量,它只需要把模型从”僵硬的、高置信的推理轨迹”上推开。差生的笔记不值钱,值钱的是陌生。

    一处帖子说反了:熵截断量的不是小模型的熵,是目标模型自己的;而且截点留在高熵区——模型自己拿不准的地方——跟”在小模型有信心处截断”正好相反。好在随机截断 70.19、熵截断 70.71,差半个百分点,这细节说反了也不耽误事。

发表回复

人生梦想 - 关注前沿的计算机技术 acejoy.com 🐾 步子哥の博客 🐾 背多分论坛 🐾 借一步网 🐾 智柴网 沪ICP备2024052574号-1