「GPT-5.6 构建者指南:把智能体的账算明白了」

OpenAI 8 月 13 日发的不是一张新模型卡,而是一份"怎么把 agent 跑便宜"的施工手册。GPT-...

OpenAI 8 月 13 日发的不是一张新模型卡,而是一份”怎么把 agent 跑便宜”的施工手册。GPT-5.6 家族的卖点就四个字:价格性能。

成本账

最直观的一组对比:BrowseComp 这个搜事实的基准上,三个月前 GPT-5.5(Extra High)跑出 84.36% 花了 33.27 美元;发布时 GPT-5.6 Luna(Extra High)拿到 84.04%,只花 1.33 美元。Hypha 的工程负责人说得更狠:Luna 用十八分之一的成本保住了 GPT-5.5 的 98% 抽取准确率。

更关键的是”架构级省钱”。GPT-5.6 端到端训了三件套:推理跨轮持久化(保留 reasoning)+ 原生压缩(compact 长对话)+ 程序化工具调用(把过滤、聚合、编排移出模型上下文)。效果在 ARC-AGI-3 上炸裂:标准 harness 13.3%,开了”保留推理+压缩”后跳到 38.3%,还少用约 6 倍输出 token——模型没变,性能近三倍。Rogo 的金融研究场景,程序化工具调用把输入 token 砍了 21%。

省钱的边界

便宜有前提。OpenAI 反复强调”调低 reasoning effort”:GPT-5.6 Sol 在 low 档就能压过 GPT-5.5 high 档(harness 不变)。小模型 Luna/Terra 适合高吞吐、低延迟、agent 流程里的重复步骤——比如法律科技先用手写备忘录抽取,再进 frontier 分析。prompt 缓存 TTL 拉长到至少 30 分钟、可设确定性断点,又帮一批 startup 把未命中输入砍了 28%。

便宜不是终点,是拐点

这份指南真正在说的,是 agent 的经济学变了:曾经每步都得 frontier 模型的事,现在用小模型 + 调 reasoning + 架构取舍,就能拿到持平甚至更好的结果。当”贵”不再是做智能体的硬约束,赌注就转移到了谁能把 harness 设计得更省——成本,成了新一代 AI coding 的核心竞争力。

发表回复

人生梦想 - 关注前沿的计算机技术 acejoy.com 🐾 步子哥の博客 🐾 背多分论坛 🐾 借一步网 🐾 智柴网 沪ICP备2024052574号-1