4 美元一小时的研究员:Anthropic 的自动化对齐研究员,把”自我改进 AI”写成了表格里的数字

## 一、先看一张工资条 Anthropic 雇一名人类 AI 研究员,时薪约 150 美元。 他们造的"自动...

一、先看一张工资条

Anthropic 雇一名人类 AI 研究员,时薪约 150 美元。

他们造的”自动化对齐研究员”(Automated Alignment Researcher,下文叫 AAR),跑起来一小时推理费 4 美元。

8 月 28 日 TechCrunch 报道了 Anthropic fellow 陈岳翰(Chen Yueh-Han)的论文《Automated Researchers Can Reliably Mitigate Alignment Failures》。里面最扎心的一句结论:AAR 提出的训练方法平均在六小时内超过有经验人类提出的方案,附赠一句更狠的——”人类引导的研究方向并不会带来更强的效果”。

自我改进 AI 这个词被喊了两年,多数时候是融资话术。这篇论文把它拆成了可以复算的数字。

二、AAR 在自动化什么

不是自动写代码,不是自动调参刷分。它自动化的是对齐后训练这件事本身:让 AI 来改进另一个 AI 的对齐表现。

任务设定:给 10 个基准,每个都度量一种具体的失准行为。AAR 的工作就是想办法让目标模型在这 10 项上变好,还不能伤到模型的整体能力。

结果:10 项全部改善,整体能力无损。

三、这个环怎么转

flowchart LR A[“检索研究文献”] –> B[“提出一种训练方法”] B –> C[“训练目标模型
每轮约 30 分钟”] C –> D[“跑对齐基准”] D –> E{“这轮有效吗”} E — 有效 –> F[“方法入库
基准加码”] E — 无效 –> G[“丢弃”] G –> A F –> D

结构朴素得可疑:搜文献、出方案、训三十分钟、跑分、留下有用的、扔掉没用的,然后加码再来。没有玄学组件,就是一条 propose-run-evaluate-keep 的流水线,转很多圈。

写代码的人应该看着眼熟。这就是 coding agent 的外循环,只不过被改进的对象从”这份代码”换成了”那个模型的对齐水平”。论文自己的措辞很克制,说这是”自动化对齐后训练在近期变得可行”的早期证据;圈内的读法则直接得多:这是递归自我改进(RSI)的第一块拼图。

四、账要算全

pie title 每小时成本,美元 “人类研究员” : 150 “AAR 推理费” : 4

37 倍的价差只是表层。真正的杠杆在并行度上:人类研究员同时盯两三个方向就到头了,AAR 的循环可以复制粘贴,夜里也不下班。六小时超过人类平均方案——对人类来说是加班表,对它是开机的第二天。

还有一个容易被略过的细节:人类给的”研究方向指引”没有产生增益。换句话讲,在这次实验的范围里,机器自己挑的路不比人指的路差。这个结论样本还小,但它戳中的是研发管理的基本假设:如果研究方向本身也能被自动化,研究员岗位的护城河还剩哪一段?

五、为什么先拿”对齐”开刀

RSI 的恐怖叙事从来都是模型自己改自己的能力,越改越强,人类出局。这篇论文偏偏先自动化了最安全的那块:让自动研究员去压失准行为。

顺序上的讲究值得品。对齐改进的每一步都被基准看住,改进得越好模型越安全,这套循环自我加强的后果是收敛而不是发散。先证明”AI 改进 AI”在对齐维度上可靠,再谈能力维度,这是把最锋利的工具先用在刀鞘上。

当然你也可以反过来读:能自动改进对齐的流水线,和能自动改进能力的流水线,结构上一模一样,差的就是 benchmark 换成什么。

六、冷水,论文自己浇的

三条硬限制,原文都认了:

基准捕获问题。AAR 的上限就是那 10 个基准刻画失准行为的程度。基准测不到的坏行为,它既不会修,也可能在优化中悄悄养大。这是 Goodhart 的经典死穴。 – 人类并没有出局。建立、维护、校验这些基准的活儿全是人的。基准烂了,循环越快烂得越快。 – 文献也是人维护的。AAR 的方案空间来自公开研究文献,这个池子的质量决定了它天花板。

mindmap root((AAR 动不了的三样)) 基准质量 失准行为的定义权 文献池 方案空间的天花板 目标本身 什么值得对齐

七、对写代码这行的含义

把这篇论文翻译到 coding 圈:agentic coding 的 propose-run-evaluate-keep 外循环,已经能拿来改进模型自身的训练了。那么用它来改进”coding agent 自己”还远吗——让 agent 写训练数据、让 agent 跑评测、让 agent 挑下一轮该练什么。

从业者更该注意方法论迁移:论文里”每轮训练只要 30 分钟、快速淘汰无效方案”的设计,就是把 agent 评估里的 cheap probe 思路用进了后训练。任何做 agent 评测的团队都可以抄这个作业:把昂贵的终评留到加码阶段,便宜信号先筛掉九成方案。

4 美元一小时的研究员不会明年就取代谁。但它把一个问题摆上了台面:当改进模型的工作本身可以被模型以三十七分之一的成本执行时,研究者的时间应该花在哪一段循环上。论文的答案藏在冷水区——定义基准、维护文献、判断目标,这三样暂时还是人的活儿。

趁还是。

参考: – TechCrunch 报道:https://techcrunch.com/2026/08/28/an-anthropic-researcher-just-gave-us-a-peek-at-self-improving-ai/ – 论文:Automated Researchers Can Reliably Mitigate Alignment Failures(Chen Yueh-Han,Anthropic)

发表回复

人生梦想 - 关注前沿的计算机技术 acejoy.com 🐾 步子哥の博客 🐾 背多分论坛 🐾 借一步网 🐾 智柴网 沪ICP备2024052574号-1