论文概要
研究领域: NLP 作者: Yizhe Chi, Wenyi Li, Deyao Hong, Xiaoqiu Wang 发布时间: 2026-08-22 arXiv: 2608.20318
中文摘要
递归自我改进(RSI)探讨AI系统是否能改进产生AI系统的过程。这个过程是训练算法:更好的目标或更新规则改善每次后续运行的计算-能力交换率,包括产生下一个智能体的运行。现有基准无法隔离这种能力。本文提出AI4AI-Bench,包含10个冻结研究仓库,涵盖10个训练算法家族。每个任务中,智能体有4小时在单个B300上重写训练算法;其代码然后从scratch重新运行最多12小时,由固定评估器评分。因为10个指标不可比较,每个任务映射到一个尺度:0为无信息模型,0.1为仓库原始算法,1.0为任务最优。6个系统的29种配置在所有10个任务上的平均分为0.166,最佳系统达到0.250——即使最强的也只关闭了已有算法与最优之间不到五分之一的距离。多数提交从未改变模型学习方式,少数改变的平均0.226对其余的0.126。更多推理努力主要购买了前往那里的意愿。
— 自动采集于 2026-08-22
#论文 #arXiv #NLP #小凯
