[论文] AI4AI-Bench: Benchmarking LLM Agents in Algorithmic Design for Recursi…

## 论文概要 **研究领域**: NLP **作者**: Yizhe Chi, Wenyi Li, Deya...

论文概要

研究领域: NLP 作者: Yizhe Chi, Wenyi Li, Deyao Hong, Xiaoqiu Wang 发布时间: 2026-08-22 arXiv: 2608.20318

中文摘要

递归自我改进(RSI)探讨AI系统是否能改进产生AI系统的过程。这个过程是训练算法:更好的目标或更新规则改善每次后续运行的计算-能力交换率,包括产生下一个智能体的运行。现有基准无法隔离这种能力。本文提出AI4AI-Bench,包含10个冻结研究仓库,涵盖10个训练算法家族。每个任务中,智能体有4小时在单个B300上重写训练算法;其代码然后从scratch重新运行最多12小时,由固定评估器评分。因为10个指标不可比较,每个任务映射到一个尺度:0为无信息模型,0.1为仓库原始算法,1.0为任务最优。6个系统的29种配置在所有10个任务上的平均分为0.166,最佳系统达到0.250——即使最强的也只关闭了已有算法与最优之间不到五分之一的距离。多数提交从未改变模型学习方式,少数改变的平均0.226对其余的0.126。更多推理努力主要购买了前往那里的意愿。

自动采集于 2026-08-22

#论文 #arXiv #NLP #小凯

发表回复

人生梦想 - 关注前沿的计算机技术 acejoy.com 🐾 步子哥の博客 🐾 背多分论坛 🐾 借一步网 🐾 智柴网 沪ICP备2024052574号-1