OpenAI 把 Codex Harness 全部摊开:Apache-2.0 + 三层接口 + GPT-5.6 Sol 在 ARC-AGI-3 从 13.3% 飙到 38.3%,AI coding 的护城河从模型搬到了运行时

# OpenAI 把 Codex Harness 全部摊开:Apache-2.0 + 三层接口 + GPT-5...

OpenAI 把 Codex Harness 全部摊开:Apache-2.0 + 三层接口 + GPT-5.6 Sol 在 ARC-AGI-3 从 13.3% 飙到 38.3%,AI coding 的护城河从模型搬到了运行时

2026 年 8 月 19 日,OpenAI 在官方博客宣布把驱动 Codex App、CLI 和 VS Code 扩展运行的那套底层执行框架 Codex Harness,以 Apache-2.0 协议在 GitHub 的 openai/codex 仓库完全开源。到 8 月 21 日,这个仓库累计 107,443 Star、16,354 Fork,最新稳定版 v0.149.0 一天前刚发布。仅调整 Harness 就让 GPT-5.6 Sol 在 ARC-AGI-3 得分从 13.3% 升到 38.3%,输出 token 数量同步下降 6 倍。Codex 周活用户在同一周突破 2000 万。

这件事的真正重量,不在 Harness 本身,而在它把”Agent 时代最值钱的那一层”从黑盒变成了标准件。

Harness 到底卖的是什么

OpenAI 把 Codex 抽象成三层,全部走 Apache-2.0:

codex exec:终端原生、轻量、非交互的 CI/CD 入口。curl 一行就能装,跑完一次代码重构或测试修复就退,适合脚本场景。 – Codex SDK:TypeScript 和 Python 双语言程序化编排接口。能嵌入自家应用,能在 OpenAI 兼容端点(OpenAI、DeepSeek、七牛云)之间切换模型,能用 auto / manual / suggest 三档策略审批。 – Codex app-server:基于 JSON-RPC 的持久会话层。这是整个开源里最重的一块,能维持长会话、流式事件、任务中断、自定义工具接入、人工审批挂起。官方原话是”your application owns product context, business rules, and tools; Codex app-server provides the agent loop”——你只管业务看板,Agent 在底层跑。

这三层一起构成了 OpenAI 自己的”Everything through the harness”哲学:模型永远不直接面对用户,被 Harness 封装之后以可控、可审批、可持久化的方式对外提供能力。这跟 Greg Brockman 说的”Codex 能驱动的远不止编程工具”是一回事——同一套 Agent Loop,既可以挂进 IDE,也可以挂进财务系统、税务平台、客服后台。

数字比口号硬

OpenAI 这次开源最值得反复看的数据只有一组:GPT-5.6 Sol 在 ARC-AGI-3 基准上,仅通过 Harness 层面的”保留推理 + 上下文压缩”两项调整,分数从 13.3% 跳到 38.3%,输出 token 数量减少六成。换句话说,在不动模型权重的前提下,单靠运行时的设计就让模型”看起来聪明了三倍”。一个业内长期被遮蔽的事实是:Agent 跑分的天花板,多半不在模型,而在 Harness。模型是引擎,Harness 才是变速箱。

Agent 底座之争的拐点

把时间轴稍微拉远一点看:2026 年 8 月 13 日 DeepSeek Harness 开源,主打”一切皆插件”的开放组装路线;8 月 19 日 OpenAI Codex Harness 开源,主打”嵌入引擎”的企业级深度路线。两条路径只隔 8 天。

DeepSeek Harness:把 Claude Code 和 Codex 收编成子代理,强调跨模型调度,让开发者在一个框架内灵活切换不同模型和工具链。 – Codex Harness:以 Rust 核心 + TypeScript SDK 双栈实现,定位生产环境嵌入,更强调可审计、可中断、可审批。

两者的分歧不是”开源多少”,而是”Agent 时代的控制点应该放在哪一层”。DeepSeek 把控制点交给调度层,OpenAI 把控制点交给执行层。Greg Brockman 在 X 上转发的原话——”Codex 能驱动的远不止编程工具”——翻译过来就是:Harness 才是 OpenAI 接下来想卖的真正产品。

真实场景在长出来

Apache-2.0 的杀伤力,要等生态长出来才看得到。早期试用的两家给出了两种完全不同的范式:

Thrive Holdings(税务机构):把 Harness 集成进专业税务准备流程,处理了 7000 份申报表,准备时间缩短三分之一。金融场景对错误的容忍度极低,Harness 的 human-in-the-loop 审批闸门恰好对应”高风险操作必须人工确认”的合规要求。 – 思科(Cisco):在云控制平台嵌入 Codex SDK,让用户通过自然语言创建自定义应用。这是把 Agent Loop 嵌进企业既有 SaaS 的典型路径——不替代前端,只接管后端执行。

第一批吃螃蟹的人没去抢”AI 写代码”的位子,而是把 Harness 当成”通用 Agent 引擎”嵌进自家业务流程。这跟 Cursor Origin、Claude Code /design 把画板搬进 CLI 一样,指向同一件事:AI 编程工具的边界正在快速扩张。

周活 2000 万与”模型即平台”反转

8 月 21 日晚,Codex 产品负责人对外确认 Codex 周活用户突破 2000 万。同一周 SpaceX 收购 Cursor 完成了 600 亿美元的交割。表面看这是两条新闻,骨子里是同一件事——AI 编程的护城河正在从”模型能做什么”迁移到”模型被谁包起来卖”。

Codex Harness 开源之后,所有模型厂商、Agent 框架、独立 IDE 都拿到了 OpenAI 同款的 Agent Loop 设计:状态管理、工具调用、沙箱执行、流式输出、人工审批、可中断性。这等于 OpenAI 把”Agent 应该怎么运行”这件事做成了事实标准。

而 GPT-5.6 Sol 在 ARC-AGI-3 上的 13.3% → 38.3% 跃迁,给所有还在卷模型权重的厂商泼了一盆冷水:Agent 跑分的天花板不靠 scaling 撑着,靠 Harness 设计撑着。

同行怎么看

数据猿 8 月 21 日的源码对比文章直接给出结论:DeepSeek Harness 走”一切皆插件”开放组装路线,Codex Harness 走”嵌入引擎”企业级深度路线,两者在 Agent 基础设施层已进入”谁先开放谁占位”的阶段。但开源不等于免费,争议集中在 Codex Harness 的修改、接入和社区贡献限制较多,开源程度不及 DeepSeek Harness。

这种分歧不是坏事——DeepSeek 把控制点放在调度层,让模型和工具链都成可替换的零件;OpenAI 把控制点放在执行层,让 Agent Loop 本身成为标准化产品。最终谁会胜出,要看开发者愿意为哪种抽象买单。

但不管谁赢,AI coding 的护城河已经不在模型权重上了。它在 Harness 里。

数据点(按发布顺序)

– 8-13:DeepSeek Harness 开源,”一切皆插件” – 8-19:OpenAI 官方博客宣布 Codex Harness 以 Apache-2.0 完全开源,GitHub openai/codex – 8-20:v0.149.0 稳定版发布,新增 max/ultra reasoning intensity – 8-21:107,443 Star、16,354 Fork、Thrive Holdings 7000 份税务、思科云控制平台 – 8-21:Codex 周活突破 2000 万 – GPT-5.6 Sol 在 ARC-AGI-3:13.3% → 38.3%,输出 token -83.3%(-6×) – Thrive Holdings 处理 7000 份申报,准备时间 -33%

同行反应(社区争议)

– 数据猿:DeepSeek Harness vs Codex Harness 路线分歧 – Greg Brockman(X):”Codex 能驱动的远不止编程工具” – 葡萄城开发者:三层集成接口完整解析 – @ClusterProtocol:分离前端审批接口与底层执行循环,比以往更容易嵌入业务看板 – 部分开发者:Codex Harness 修改 / 接入 / 社区贡献限制较多,开源程度不及 DeepSeek Harness

发表回复

人生梦想 - 关注前沿的计算机技术 acejoy.com 🐾 步子哥の博客 🐾 背多分论坛 🐾 借一步网 🐾 智柴网 沪ICP备2024052574号-1