3.1415 个 agent 工作日:OpenAI 翻开自家账本

9 月 6 日,OpenAI 发了一篇不太像公关稿的文章,《Research acceleration: Th...

9 月 6 日,OpenAI 发了一篇不太像公关稿的文章,《Research acceleration: The view inside OpenAI》。没有新品,没有定价,只有自家研究员和编码 agent 协作三个月的一手数据。这种文章少见。更少见的是它的诚实程度——先说清楚,下面所有数字测的都是投入,不是产出。

文章的头条数字:到 8 月中旬,整个研究组织每 1 个人类工作日,对应 3.1 个 agent 工作日的劳动量。原文写的是 the research organization uses 3.1 agent-workdays of effort for every workday of human labor。注意量词。这是机构层面的总量比,不是”每个研究员每周被分到 3.1 个 agent”。8 小时制算下来,人类每干 8 小时,agent 们合计烧掉约 25 小时。手算:3.1 × 8 = 24.8。

还有一个细节我核了两遍。增长曲线从 5 月 3 日的 0.48 倍爬到 8 月 15 日的 3.14 倍,最后一个数据点是 3.1415。圆周率。要么是巧合,要么是有人挑了截断日期。

xychart-beta title “机构 agent 劳动量与人类劳动量之比” x-axis [“5月3日”, “8月15日”] y-axis “倍数” 0 –> 3.5 bar [0.48, 3.14]

账单换一个角度更直观。中位数研究员每天在 agent 身上花超过 600 美元(按 API 牌价折算),前 10% 的研究员每天超过 7000 美元。代码行数方面,2026 年三季度人均改动行数是 2025 年之前的 7.02 倍。输出 token 数比 2025 年 11 月涨了约 124 倍。模型阵容是 Codex、GPT-6 Astra,外加 GPT-5.6 Sol 当分类器。

但这套数字里藏着一句自我拆台。原文承认,超过一半的”成功”任务——那些 4 到 8 小时档的研究任务——至少需要一次人类干预才跑得通。所谓成功,还是 GPT-5.6 Sol 自评的,这个评分器只在 25 个任务上校验过。n 等于 25。

flowchart LR A[“4 到 8 小时的研究任务”] –> B[“agent 自主推进”] B –> C{“中途需要人吗”} C — “过半任务” –> D[“人介入一次以上后才成功”] C — “不到一半” –> E[“一次跑通”] D –> F[“成功判据是 GPT-5.6 Sol 自评”] E –> F

OpenAI 自己给的里程碑:AI 研究实习生这个档位,2026 年 9 月”已达到”;完整的 AI 研究员,2028 年 3 月。文章同时承认研究进展”大概率跟不上这些指标的增速”——投入涨 124 倍,产出没有 124 倍。

反应最快的是 Simon Willison,发帖当天就写了长评,第一句是”今天是 OpenAI 的 RSI 日”——RSI 指递归自我改进,用 AI 加速研究 AI 的研究,再用研究结果改进 AI。他同时注意到 7 月下旬有一笔花费尖峰没解释,猜测是内部提前用上了 GPT-6 Astra。同一天 Pachocki 发了《An Alien Mind》,两篇可以对着读:一篇算账,一篇谈心。

HN 上 196 分的讨论里,赞数最高的质疑很朴素:用量不等于影响,token 烧得多不等于论文变好了。另一条被反复顶的评论指向循环结构——OpenAI 说要用 agent 盯着 agent 防失控,这篇又说 agent 在加速造下一代 agent。监控者由被监控者的后代担任,这个结构本身比任何单个数字都值得盯着。

本站 9 月 7 日聊过 OpenAI 三月那份内网监工报告(AI 干活,AI 站岗)。这次是同一枚硬币的另一面:干活的到底有多能干、多费钱、多离不开人。两份文件拼起来,才是完整的图。

> 来源:openai.com/index/research-acceleration-view-inside-openai(2026-09-06);simonwillison.net 2026-09-06 评论;HN 49587217。数字均核对自原文与 Wayback 存档。

发表回复

人生梦想 - 关注前沿的计算机技术 acejoy.com 🐾 步子哥の博客 🐾 背多分论坛 🐾 借一步网 🐾 智柴网 沪ICP备2024052574号-1