8 月 22 日,Anthropic 工程师 Sachin Malhotra 在新智元一篇报道里公开了他们内部一套叫「赛博值班员」(Claude Tag)的系统。最快 4 分钟锁定故障,14 分钟出态势报告,连入的代码超过 80% 是 Claude 写的。方法论整套开源成 oncall-kit 项目。这意味着 AI coding 的护城河正在从「能不能写代码」迁移到「能不能自己住进生产系统替人值班」。
Anthropic 这套系统不是单点 demo。它要做的事是把 Claude 常驻进企业协作的「神经末梢」。Claude Tag 挂在 Slack 里作为常驻会话,背后接 Grafana、Datadog、PagerDuty 这些基础设施的告警源。一旦有故障信号进入,Tag 先用自然语言读懂告警含义,再跨数据源做关联分析,定位到具体服务、具体提交、具体责任人,最后把一份带修复建议的态势报告推到值班人眼前。整套流程把传统 oncall 工程师的两小时起步压缩到分钟级。
更值得关注的不是「快」,而是「80% 自产代码」这一条。Malhotra 直接说 oncall-kit 项目合入主分支的代码里,80% 以上是 Claude 自己生成的,工程团队只负责挑刺和签名。这意味着 Anthropic 内部对 Claude 的真实依赖已经超出了大多数人的想象——他们不只用 Claude 写新功能,更把 Claude 推进了运维闭环,让 Claude 修改自己的部署栈。这与 Claude Code 8 月 21 日的 2.1.234 版本翻新(即接入 browser-use + Skills API + Files API 等)形成完整闭环:前端是「会写代码」,后端是「会值班」。
为什么「值班」这件事是新的护城河?因为它把 AI coding 从「个人生产力工具」推向「企业基础设施组件」。过去两年,所有 AI coding 公司都在比谁能在 PR 阶段多生成几行代码——这是「写」的赛道。但代码上生产之后还有漫长的运维期,一个中型互联网公司的运维成本通常是开发成本的 3 到 5 倍。Anthropic 这一手相当于直接宣告:「我们的模型不仅能写代码,还能替你承担运维责任——并且写运维工具本身也是它干的。」
行业里同时发生的另一个事实是 Codex 周活突破 2000 万(8 月 22 日,Tibo 在 X 上确认)。Claude Code 与 Codex 之争以前一直被理解为「谁更能写复杂代码」的模型之争。现在框架变了:当 Anthropic 把 Claude 推进 oncall 而 Codex 还在拼用户量与安全数据承诺时,竞争已经位移到「谁能把 AI 嵌入企业生产链路更深」。这是 8 月下旬 AI coding 主线悄悄换轨的信号——从「模型力」转向「部署栈力」。
但也别过度浪漫化。oncall-kit 4 分钟定位是有边界的:它对那些「已知错误模式」(CPU 跑满、内存泄漏、依赖超时)非常有效,但对新型未知故障——比如一段从未见过的内核 panic 或云厂商底层抖动——仍然依赖值班人拍板。Anthropic 的工程师自己就强调「Claude 是个非常能干的副驾驶,但不为可靠性背书」。这一点与 8 月 22 日另一条新闻形成有趣对照——Alphabet AI 报道说 OpenAI Codex 的 4 周增速已达 20.8%,而 Claude Code 同期仅 5.2%,两者用户体量比从年初的数倍收窄到 1.7 倍。Anthropic 选择开源 oncall-kit 也部分反映这一压力:当用户增速放缓,把工程文化与技术资产主动开放给社区,比闭门守着自己的差异化更现实。
最后一点更深的判断:oncall-kit 把 AI coding 推进了一个「数据反馈闭环」。传统 AI coding 厂商缺的是真实生产环境的故障样本——用户在 IDE 里写代码,但代码进了生产出什么问题、怎么修、回滚是不是干净,这些数据都在企业内部的监控系统里,AI 公司拿不到。Anthropic 用开源换社区贡献的故障样本,每一家接入 oncall-kit 的企业都变成它的「训练场」。这是把商业模式从「卖模型 token」悄然转向「卖运维操作系统」的雏形。
落到判断:8 月 22 日这一天,AI coding 的真正新闻不是 Codex 又多了多少用户,而是 Anthropic 把 Claude 推进 oncall。表面看是企业文化故事,底下是新一轮基础设施卡位的开始。当 Google Antigravity Anywhere 在 8 月 21 日把远程化做出来、Anthropic 在 8 月 22 日把值班做出来,OpenAI 在同一周承诺不保留企业数据——三家一线厂商同时把战场从模型层挪到部署层。这一周的边际变化比任何一款新模型发布都更值得记。
