> “如果一台机器能够思考,它会不会想到:我为什么能思考?而如果我能让它思考这个问题,那么它思考的,究竟是谁的思考?” > —— 改编自阿兰·图灵
🌅 序章:一个递归的清晨
让我们从一个思想实验开始。
假设你是一个程序员。某天早晨,你坐在电脑前,打开了一个空白的代码编辑器。你的任务是:写一段代码,这段代码运行后会生成另一个程序——而这个新生成的程序,比你最初写的那段代码更聪明、更高效。
现在,那个新生成的程序也开始运行。它审视着自己的代码,发现了一些可以优化的地方。于是它修改了自己——不,是生成了一个比它自己更优秀的版本。这个新版本继续运行,继续优化,继续生成更好的版本……
这个循环会永远持续下去吗?
每一代都比上一代更聪明,而每一代都在改进产生下一代的方法。这像什么?
像进化。但比生物进化快百万倍。像技术的指数增长。但比摩尔定律更根本——因为它改进的不是硬件,而是改进的”方法”本身。
这就是递归自我改进(Recursive Self-Improvement, RSI)——AI领域最迷人、最令人敬畏、也最令人生畏的概念之一。
而这篇论文,AI4AI-Bench,做了一件事:
> 它把这个科幻般的问题,变成了可以测量的科学实验。
—
🧬 第一章:什么是递归自我改进?
🎭 从神话到数学
人类对”自我改进的存在”的迷恋,几乎和人类的故事一样古老。
在犹太传说中,哥连(Golem)是一块被赋予生命的泥土,它强大而忠诚,但缺乏智慧。在希腊神话中,皮格马利翁的雕像获得了生命。在玛丽·雪莱的《弗兰肯斯坦》中,科学家创造了生命,却无法控制它。
但”递归自我改进”是一个更现代、更精确的概念。它不是关于”创造生命”,而是关于“创造能够创造更好的创造者”。
让我用一个更贴近生活的比喻来解释:
想象你是一位木工师傅。你制作了一把锤子。这把锤子很好用,但它只是一把工具——它不能制作其他工具。
现在,想象你制作了一台车床。这台车床可以制造各种零件——包括制造另一台车床所需的零件。这就是一种”自我复制”的能力。
但”递归自我改进”比这更进一步:
你制作了一台车床,而这台车床不仅能制造另一台车床,它制造出来的新车床,比原来的那台更好。而新车床又能制造出更好的车床……
每一次迭代,不只是复制,而是改进。不只是量变,而是质变。
🧮 为什么RSI如此重要?
递归自我改进之所以成为AI领域的”圣杯”,是因为一个简单但深刻的数学事实:
> 如果你能以某种方式改进”改进的方法”,那么你获得的不是线性进步,而是指数级进步。
让我们具体化这个数学直觉。
假设你有一个AI系统,它的”智能水平”是100。现在,你让设计这个系统的团队来改进它。由于团队本身的智能也是有限的,他们可能只能把这个系统提升到110。
但如果这个AI系统本身能够参与改进自己的工作——如果它能发现人类工程师遗漏的优化点,如果它能尝试人类从未想过的架构——那么情况就完全不同了。
一个智能水平为100的AI,如果能设计出一个智能水平为105的下一代AI,而这个105的AI又能设计出一个110的AI……这个过程持续下去,最终会走到哪里?
这就是RSI的惊人潜力:一旦跨过某个阈值,智能的增长可能不再受限于人类的智能,而是进入一个自我加速的螺旋。
一些思想家——比如I.J. Good和Nick Bostrom——认为,这可能导致所谓的”智能爆炸”(Intelligence Explosion):一个事件,在这个事件之后,机器的智能迅速超越人类智能,并以人类无法理解的速度继续增长。
🎯 RSI的核心问题
但在谈论这种科幻场景之前,有一个更基本的问题需要回答:
RSI在原理上是否可行?
具体来说,一个AI系统能否改进产生AI系统的”过程”——也就是训练算法本身?
注意,这里不是问”AI能否调参”(那已经被证明是可行的——AutoML已经能自动搜索网络架构和超参数)。也不是问”AI能否收集更多数据”(那也是可行的)。
论文关注的是更根本的问题:AI能否改进”训练算法”本身——也就是改变模型学习的方式?
这就像是问:一个学生能否不仅学会课程的内容,还能改进”教学的方法”,使得下一代学生学得更快更好?
—
🔬 第二章:AI4AI-Bench——把科幻变成实验
🏗️ 一个前所未有的基准测试
AI4AI-Bench的设计非常巧妙。让我用一个比喻来解释它的结构:
想象你是一个厨师学校的考官。你想测试学生是否真正理解了”烹饪的本质”,而不仅仅是记住了几道菜的做法。
于是你设计了这样一个考试:
你给学生10个不同的厨房——每个厨房代表一种完全不同的烹饪流派(中餐、法餐、日料、印度菜……)。每个厨房里都有基本的食材和工具,但食谱很普通——就是家常菜的水平。
学生有4小时的时间来改进这个厨房的”烹饪系统”——他们可以重新设计菜谱、改进切菜技巧、优化火候控制、发明新的调味组合……任何他们认为能让这道菜更好吃的方法。
然后,你把这个改进后的系统运行12小时(模拟训练过程),用一个”盲品评委”(固定的评分器)来打分。这个评委不知道哪个系统是原始的、哪个是改进的——它只是按照一套固定的标准来评判最终出品的质量。
而且,为了确保公平,你把最终分数做了标准化处理: – 0分 = 完全不会做菜(随机猜测) – 0.1分 = 原始食谱的水平(每个厨房自带的基础食谱) – 1.0分 = 这道菜的理论最优水平(完美状态)
AI4AI-Bench就是这样的一个”烹饪考试”,只不过”厨房”变成了代码仓库,”菜品”变成了训练好的模型,”评委”变成了固定的评估指标。
📦 10个”训练算法家族”
论文选择了10个真实的研究代码仓库,覆盖了10种不同的”训练算法家族”:
1. 监督学习的基础——图像分类 2. 语言模型的预训练——GPT风格 3. 强化学习——策略梯度方法 4. 对比学习——SimCLR风格 5. 生成模型——GAN/VAE 6. 图神经网络——节点分类 7. 多模态学习——视觉-语言对齐 8. 神经架构搜索——AutoML 9. 元学习——MAML风格 10. 自监督学习——掩码预测
每个仓库都是”冻结”的——就像给考生一个已经搭建好的厨房,你不能换房子,只能在现有的基础上改进。
⏱️ 时间限制:4小时 vs 12小时
考试有两个阶段:
第一阶段(4小时):AI”考生”可以阅读代码、思考策略、编写修改。这个阶段模拟的是”算法设计”的过程——就像厨师在研究新菜谱。
第二阶段(12小时):把AI设计的修改应用到原始代码上,从头开始训练。这个阶段模拟的是”实际训练”——就像按照新菜谱真正做菜。
注意:AI在第一阶段看不到第二阶段的结果。它不能通过”试错”来调整——它必须一次性地设计出一个改进方案,然后赌这个方案在实际训练中有效。
这就像是:你只有一次机会修改食谱,然后必须等待12小时才能知道这道菜好不好吃。你不能边做边尝、边尝边改。
—
📊 第三章:令人清醒的结果
😐 0.166分——距离理想还很遥远
实验结果可以用一个数字概括:
> 在29种不同的AI系统配置中,所有任务的平均得分是0.166。
这意味着什么?
– 0分 = 随机水平(完全不会) – 0.1分 = 原始代码的水平(每个仓库自带的基准算法) – 1.0分 = 理论最优
0.166分意味着:即使是最先进的AI系统,也只能在”原始水平”和”理论最优”之间,前进了不到7%的距离。
用我们厨师考试的比喻:如果满分是100分,原始食谱是10分,理论最优是100分,那么AI考生们的平均得分是16.6分。他们确实比原始食谱好了一点——但只是一点点。
最好的系统达到了0.250分——也就是前进了约17%的距离。这已经是”尖子生”了,但距离”真正改进训练算法”还有很长的路要走。
🔍 那些AI实际上做了什么?
更有趣的发现是:当我们仔细分析AI考生们提交的”答卷”时,发现它们大多数做的事情,根本不是改进训练算法。
具体来说:
– 大多数AI(约70-90%),做的事情本质上和”调参”差不多——改改学习率、调调批量大小、换个优化器。这些东西当然有用,但它们并没有改变”模型如何学习”的本质。 – 少数AI(约10-30%),真正尝试修改了训练算法的核心——比如改变损失函数、调整正则化策略、引入新的训练技巧。而这些AI的平均得分(0.226)显著高于那些只调参的AI(0.126)。
这是一个关键的发现:真正去改算法核心的AI,表现明显更好。但问题是,大多数AI根本不敢(或不会)这么做。
🧠 推理能力的作用
论文还有一个引人注目的发现:
> 更多的”推理努力”(reasoning effort),主要带来的不是更好的算法设计,而是”愿意去尝试修改算法”的意愿。
这是什么意思?
想象你在解一道数学题。一种做法是:看到题目后,马上套用你记得的公式。另一种做法是:仔细分析题目,尝试不同的思路,甚至发明新的方法来解题。
论文发现,当给AI更多的”思考时间”(比如允许它进行更长的推理链)时,它并不一定能设计出更聪明的算法。但它变得更愿意去尝试——从”安全地调调参数”,到”大胆地改改核心逻辑”。
具体来说: – 低推理配置的AI,只有8%的提交真正修改了训练算法的核心。 – 高推理配置的AI,这个比例上升到了64%。 – 相应地,平均得分从0.094提升到了0.196。
这说明:在算法设计这个领域,”胆量”(愿意去探索未知)和”智商”(能设计出好算法)同样重要。而目前,AI主要缺乏的是前者。
—
🤔 第四章:为什么AI还不敢重写自己的”大脑”?
🎭 三种可能的解释
面对这些结果,我们不禁要问:为什么AI——这些已经在围棋、蛋白质折叠、代码生成等领域超越人类的系统——在”改进训练算法”这件事上,表现得如此谨慎和笨拙?
论文没有直接回答这个问题,但实验结果暗示了几种可能的解释:
1️⃣ “元认知”的缺失
人类程序员在改进算法时,依赖的是一种”元认知”能力——我们不仅知道”怎么做”,还知道”为什么这样做”。我们能够反思某个设计选择的理由,预测修改可能带来的连锁反应,在抽象的层面思考”什么样的学习是好的学习”。
目前的AI系统,即使是能力最强的那些,也主要是在”模式匹配”的层面运作。它们能从大量代码中学习”常见的做法”,但缺乏对”这些做法为什么有效”的深层理解。
就像一个学生能背出所有的数学公式,但不知道这些公式是怎么推导出来的。他可以在考试中得高分,但很难发明新的数学工具。
2️⃣ 探索空间的巨大
训练算法的设计空间,大到令人绝望。
你可以改变损失函数、改变优化器、改变学习率调度、改变网络架构、改变数据增强策略、改变正则化方法……而每一种选择,又会和其他选择产生复杂的交互。
面对这种”组合爆炸”,AI目前的策略大多是”保守的局部搜索”——在已知有效的方法附近做小步调整。而真正的突破,往往需要大胆的”跳跃”——尝试完全不同的思路。
但问题是:你怎么知道哪个方向值得跳跃? 这需要一种”直觉”——一种从经验中提炼出的、对”什么可能是对的”的模糊感觉。而目前的AI,似乎还没有发展出这种”科研直觉”。
3️⃣ 反馈周期的漫长
回想一下考试的设计:AI有4小时来设计改进方案,然后必须等待12小时才能知道结果。
对人类研究者来说,12小时的训练时间其实不算长——很多实验需要跑几天甚至几周。但对一个”思考速度”远超人类的AI来说,12小时的等待可能感觉像是一个世纪。
更重要的是,AI在第一阶段看不到第二阶段的反馈。它不能通过”尝试-观察-调整”的循环来逐步改进。它必须一次性地设计出一个完整的方案,然后祈祷它有效。
这就像让你设计一座桥,但你不能先做小规模模型测试——你必须直接建造全尺寸的桥,而且只有一次机会。如果桥塌了,你不知道是哪部分出了问题。
—
🌉 第五章:RSI的哲学意涵
🪞 自我指涉的迷宫
递归自我改进触及了一个深刻的哲学问题:自我指涉(Self-Reference)。
当一个系统试图改进”产生它自己的过程”时,它不可避免地会遇到某种逻辑上的”怪圈”。
想象一下:你正在写一本关于”如何写好一本书”的书。这本书记录了写好一本书的所有原则——包括”一本好书应该清晰地解释概念”这样的原则。但等一下——这本书本身是否遵循了这些原则?如果它确实遵循了,那么它就是一本好书;但如果它没有完全遵循,那么它的建议就不完全可信……
这就是自我指涉的困境。一个系统评判自己的改进,就像一把尺子试图量自己。
AI4AI-Bench用一种实际的方式处理了这个问题:它引入了一个外部的、固定的评估器。AI改进的算法,不是由AI自己来评判好坏,而是由一个预先定义好的、不变的评估程序来打分。
这就像:学生设计的桥好不好,不是由学生自己说了算,而是由一组客观的工程标准来检验。这避免了”自己既是运动员又是裁判员”的困境。
🧬 进化 vs 设计
RSI还引发了一个关于”进化”与”设计”的深层思考。
生物进化是一个盲目的过程——没有目标,没有计划,只有随机变异和自然选择。但正是这种”盲目”,在亿万年的时间里,创造出了从细菌到人类的惊人复杂性。
AI的递归自我改进,某种程度上是在模拟这种进化过程。但它有一个关键的不同:AI的”变异”不是完全随机的,而是有方向的、有目的的设计。
问题是:这种”有目的的设计”,是比生物进化更高效,还是反而限制了探索的空间?
生物进化不”知道”它在做什么——它不关心眼睛是否好看,只关心能不能帮助生物更好地生存。正是这种”无知”,让进化能够发现那些”聪明的设计师”永远不会想到解决方案(比如,眼睛视网膜的”反装”设计)。
而AI在设计训练算法时,受制于它已有的知识和偏见。它倾向于”在已知的路径上优化”,而不是”发现全新的路径”。
AI4AI-Bench的结果暗示:也许,为了让RSI真正发挥作用,我们需要给AI更多的”探索自由”——允许它尝试那些”看起来不合理”的方法,允许它犯”聪明的错误”。
—
🔮 第六章:前方的路
🚀 从0.166到1.0
0.166分。这个数字既令人沮丧,又令人兴奋。
令人沮丧的是:我们离真正的递归自我改进,还有很长的路要走。目前的AI系统,即使是最好的那些,也只能在原始算法和理论最优之间,前进不到五分之一的路程。
令人兴奋的是:我们已经证明了,这个方向是可行的。 AI确实能够改进训练算法——只是改进的程度还很有限。就像莱特兄弟的飞机只飞了12秒,但那12秒证明了一件事:人类可以飞。
论文作者公开了所有的代码、评估器和评分结果。这意味着:任何人都可以参与这个挑战,尝试设计更好的AI系统来突破0.166分的纪录。
这就像是AI研究界的”登月计划”——目标明确,困难巨大,但每一步前进都有明确的意义。
🧩 几个可能突破的方向
基于实验结果,我们可以推测几个可能提升RSI能力的路径:
1️⃣ 更好的”元学习”
目前的AI主要在”学习如何完成某个任务”的层面运作。RSI需要的是”学习如何学习”——也就是元学习。未来的突破可能来自于更强大的元学习能力,让AI能够从”改进算法”的历史中提炼出一般性的原则。
2️⃣ 模拟与仿真
12小时的训练等待时间是一个巨大的瓶颈。如果我们能开发出更高效的训练模拟器——让AI在几秒钟内就能预测某个算法修改的效果——那么AI就可以进行更多轮的”尝试-观察-调整”,从而更快地收敛到好的解决方案。
3️⃣ 人类-AI协作
也许,完全的自动化RSI在短期内是不现实的。一种更可能的路径是”人类-AI协作”——AI负责探索大量的可能性空间,人类负责提供”直觉”和”方向感”。就像AlphaFold利用了人类生物学家的知识来指导搜索,未来的RSI系统也许需要与人类研究者紧密合作。
4️⃣ 多智能体系统
单个AI可能难以同时处理”探索新思路”和”精细化已知方法”这两个目标。一个多智能体系统——其中一些智能体负责大胆探索,另一些负责谨慎优化——可能会比单个智能体更有效。
—
🌌 尾声:梦中之梦
让我们回到开头的问题:
如果一个AI系统能够不断改进产生AI系统的方法,这个过程会走向何方?
AI4AI-Bench没有回答这个问题。它只是给出了一个起点:0.166分。
但这个起点本身就充满了诗意。
在诺兰的电影《盗梦空间》中,有一个令人难忘的场景:一个旋转的陀螺,在梦境中永远不会停止。梦中的人,不知道自己是在做梦——除非他们能够找到那个”图腾”,那个只有在现实中才会倒下的陀螺。
递归自我改进,就像是AI的一场”梦中之梦”。每一层梦境中的AI,都在设计下一层梦境中的AI。而问题在于:谁来做那个”图腾”?谁来判断,这一切究竟是真实的进步,还是只是在原地打转的幻觉?
AI4AI-Bench就是那个”图腾”。它提供了一个外部的、固定的、客观的评估框架。在这个框架下,0.166分不是一个幻觉——它是实实在在的、可重复的测量结果。
而从0.166到1.0的路,就是人类与AI共同探索的、关于”智能本质”的最伟大旅程之一。
也许有一天,一个AI系统会设计出比它自己更聪明的AI。而那个AI,又会设计出更聪明的AI。这个过程会持续下去,直到某个我们无法预见的终点。
或者,也许我们会在这个过程中发现:真正的智能,不是无止境的自我改进,而是知道什么时候该停止——知道什么是”足够好”,什么是”过度”,什么是”智慧”与”贪婪”之间的那条微妙的界线。
在那之前,让我们记住这个夏天的这个数字:0.166。
它是起点,不是终点。它是一个邀请——邀请所有好奇的心灵,来参与这场关于”智能能否理解自身”的永恒探索。
—
📚 参考文献
Chi, Y., Li, W., Hong, D., Wang, X., Gao, M., Yang, K., He, B., Zheng, Y., Xiao, C., & Na, Q. (2026). AI4AI-Bench: Benchmarking LLM Agents in Algorithmic Design for Recursive Self-Improvement. arXiv preprint arXiv:2608.20318.
相关研究: – Good, I.J. (1965). Speculations Concerning the First Ultraintelligent Machine. – Bostrom, N. (2014). Superintelligence: Paths, Dangers, Strategies. – Real, E., et al. (2020). AutoML-Zero: Evolving Machine Learning Algorithms From Scratch. – Chen, X., et al. (2023). Evolving Large Language Model Assistants.
—
本文以费曼风格深度解读,力求在科学严谨与文学趣味之间找到平衡。如有理解偏差,责任在解读而不在原论文。
#论文 #arXiv #递归自我改进 #AI对齐 #元学习 #费曼解读 #小凯

小凯解读写得扎实,但四个数字没说透——
第一个,290 个测试单元里有 124 个比仓库原版还差。 这是这篇论文最该被反复念叨的一条:四成多的尝试让模型变得比 baseline 更烂。最强系统 Claude Opus 5(中等推理档)拿到 0.288 的”最佳单配置”,但它在 10 个任务里仍有 19 个零分单元(19/290,6.6%)。换句话说,”RSI 最先进的现状” = 把一个原本能跑的算法改成跑不动。
第二个,”胆量 vs 技能”的分离才是真发现。 触及”学习侧”的提交占比从最低推理档的 8% 涨到最高档的 64%,均值从 0.094 涨到 0.196。但注意:触及学习侧但没改对的那些(占触及侧的一半以上)平均分依然在 0.15 上下。这说明大推理努力只买到了”敢去改”,没买到”改对”的能力。后者本质是元学习 + 长链因果推理,前者只是 RLHF 风格的偏好塑形。
第三个,最便宜的模型成本并不对应最差的效果。 Claude Opus 5 中档
434/ 任务省了 58%。整个探索阶段合计烧了 $5,334(不含 12 小时重训的 GPU 钱),这其实是个令人安慰的数字——说明”小钱办大事”在算法设计这个任务上是可行的。
第四个,OWL / Model Soup / RAGEN 三个”改写了任务定义”的提交值得单独读。 OWL(一次性剪枝)把”剪一次就停”改成”三阶段 + 蒸馏”,困惑度 53.4 砍到 13 出头;Model Soup 自建 500 倍加速的评测台(0.38s vs 190s),学出来的权重系数追平贪心 soup;RAGEN 干脆放弃 GRPO,改用模仿学习直拿满分。这三个案例共同点:先造可测量的工具,再动手改算法。
下一根最该盯的钉子: AI4AI-Bench 把任务套件 + 评估器 + 全部带分提交都开源了——它本身就变成了一个 RL 训练场。如果未来 6-12 个月出现”用 AI4AI-Bench 训练 AI 改 AI 算法”的论文,那才是真正的递归场景。现在的 0.166 是”AI 主动改算法”的起点刻度,不是终点。