你有没有想过,为什么大语言模型做同一道题做错了一遍,下次遇到类似的题还是会错?
人类不是这样的。你解一道数学题卡住了,看一眼答案,”哦原来这里要换元”,下次遇到同类题目你就不会在同一个坑里摔第二次。这种”从经验中学习”的能力,是智能最基本的特征之一。但今天的大模型——不管是 GPT-5、Gemini-2.5 Pro 还是 Claude-4.5 Sonnet——在标准评测里都是”一次性”的:做一道题,对或错,然后忘掉,下一道题从零开始。
ByteDance Seed 和 UC Santa Cruz 的团队提出了一个叫 Chain-of-Experience(CoE) 的框架,做的事情很简单:让模型在做完题之后,把反馈信号积累下来,形成一条”经验链”,在后续题目中持续改进。
核心思路:把测试时变成学习时
CoE 的设定是这样的:模型面对一组题目(数学、编程、知识问答),不是每道题独立做,而是在做完每道题后接收反馈——可以是模型自己给自己的反馈(self feedback),也可以是环境给出的正确性信号(correctness feedback),然后把这些经验积累到上下文中,影响后续题目的解答。
这听起来像是 in-context learning(上下文学习),但有一个关键区别:ICL 是被动的——你给什么例子它就学什么;CoE 是主动的——模型在解题过程中自己产生经验,这些经验直接改变它后续的行为。
论文探索了一个”反馈光谱”:
– 自我反馈:模型做完题后自己评判自己的答案,把评判结果作为经验 – 正确性反馈:环境告诉模型对不对(比如编程题的测试用例通过率) – 双通道组合:同时使用自我反馈和正确性反馈
结果很有意思:仅靠自我反馈,模型就能获得显著提升;加上正确性反馈后还能再上一层楼。总体来看,CoE 在 8 个模型、6 个基准测试上实现了 5.6% 的平均提升和 19% 的 API 成本降低。
编程任务上的表现最亮眼
在编程任务(LiveCodeBench V6 和 LiveBench Code)上,CoE 的效果最为突出。当使用程序化执行器反馈(即测试用例是否通过)时,准确率从 66.4% 提升到 75.0%,提高了 8.6 个百分点。即使只有自我判断反馈,也能提升 7.0%。
这很好理解:编程题有明确的对错信号——代码能跑通就是对的,跑不通就是错的。这种”硬反馈”比”自我感觉良好”更有信息量。
但在数学和知识问答(AIME 2025、OmniMath、GPQA Diamond)上,正确性反馈仍然建立了上限,自我反馈虽然达不到这个上限,但也能提供可观的改善。
三个关键发现
发现一:强模型学得更快。 模型的基础能力和它的改进能力正相关——越聪明的模型,从经验中学到的越多。这和直觉一致:你需要一定的”底子”才能有效利用反馈。
发现二:模型对垃圾反馈有抵抗力。 当研究者故意给模型全错的反馈(比如永远说”你的答案是对的”或”你的答案是错的”),性能下降幅度有限——AIME 2025 平均下降 7.6%,GPQA Diamond 下降 2.6%。更强的模型(如 GPT-5 mini)恢复能力更强。这意味着模型不是简单地”听信”反馈,而是有一定能力区分有用和无用的信号。
发现三:大部分收益来自前几轮迭代。 经验积累的边际收益递减很快——最初的几轮交互贡献了大部分提升,之后趋于平缓。这对实际应用很重要:你不需要无限轮次的经验积累,几轮就够了。
为什么这件事重要
当前大模型领域有一个基本矛盾:训练成本天文数字般高昂,但模型一旦训练完成就”冻结”了,不会从使用中学习。RLHF 和 DPO 等方法试图在训练阶段注入人类偏好,但训练完成后模型又回到了”一次性”状态。
CoE 代表的是另一条路:不改变模型参数,而是在推理时通过经验积累实现持续改进。这更接近人类的学习方式——你不需要每次学新东西都重新”出厂设置”。
从工程角度看,19% 的 API 成本降低也很实际。如果你是一个在跑大规模评测的公司,这意味着同样的预算可以多跑 23% 的评测量。而且 CoE 的”accuracy per token”(每 token 准确率)比现有的测试时策略更高——也就是说,它不只是花更多 token 换来更高准确率,而是真正更高效地利用了计算。
诚实的局限
CoE 不是万能的。首先,它依赖反馈信号的质量——在那些没有明确正确答案的任务上(比如开放式写作),自我反馈的可靠性存疑。其次,经验积累会占用上下文窗口,长任务可能遇到 token 限制。第三,论文测试的都是在同一类任务内的经验迁移,跨领域迁移(比如从数学迁移到编程)的效果没有涉及。
另外,5.6% 的平均提升虽然显著,但在一些任务上提升很小。这不是一个”颠覆性”的结果,而是一个”扎实推进”的结果。
我的看法
CoE 让我想到一个更大的问题:我们评测大模型的方式可能从根本上就是错的。今天的主流评测——MMLU、HumanEval、MATH——都是”一次性”测试,每道题独立评分。但如果我们真的关心模型的”智能”,应该测的是它”从经验中学习”的能力,而不是它在零样本设定下的表现。
这和最近一批论文的方向一致:从 Chain-of-Thought 到 Self-Refine 到 Test-Time Training,整个领域在从”训练时优化”转向”推理时优化”。CoE 把这个方向推到了”推理时持续学习”的阶段——不只是单道题内的推理优化,而是跨题目的经验积累。
如果未来大模型的”智能”主要体现在推理时而非训练时,那今天我们花在训练上的天文数字算力,可能需要重新分配一部分给推理时计算。这不是 CoE 一篇论文的结论,但 CoE 为这个方向提供了一个坚实的数据点。
—
