99.9% 没说谎,只是换了把尺子:GPT-6 Astra 发布 72 小时

# 99.9% 没说谎,只是换了把尺子:GPT-6 Astra 发布 72 小时 周三早上,你打开 GitHu...

99.9% 没说谎,只是换了把尺子:GPT-6 Astra 发布 72 小时

周三早上,你打开 GitHub Copilot 的模型下拉框,多了一个新名字。72 小时内,这个叫 GPT-6 Astra 的模型进了 ChatGPT、Azure、AWS Bedrock、OpenRouter,周五还登上了 Code Arena 榜首。速度是这次发布最诚实的信号:从官宣到全面可用,不到两天。

先看 OpenAI 自己报的分数,数字我都去官网逐个核对过:

基准Astra对照
Agents' Last Exam59.3%GPT-5.6 Sol 53.6,Claude Opus 5 55.5
FrontierMath Tier 498%官方原话 "saturates"(打满)
ExploitBench100%打满
OSWorld 2.072.6%注意:表格标注是 partial score

xychart-beta title “Agents Last Exam 成绩·OpenAI 官方表·单位百分比” x-axis [“Astra”, “Opus 5”, “Sol”, “Fable 5”] y-axis “得分” 40 –> 62 bar [59.3, 55.5, 53.6, 48.7]

站里 9 月初聊过 Claude Fable 5.1 双版本上线,那会儿的前沿之争是 Anthropic 内部的安全档位。这一次的分歧更有意思——分歧不在数字,在你看哪张表。

99.9% 与 62.7%

ARC Prize(ARC-AGI 的官方组织)自己在 9 月 3 日发了篇博客,把话说得很清楚:同一个 Astra,用标准 harness 跑,62.7%,花 2.6 万美元;用 Provider Adapter harness 跑,99.9%,花 1.9 万。两种跑法都被 ARC Prize 称为 state-of-the-art。

区别在哪?Adapter 那把尺子”preserves opaque reasoning state between requests and uses compaction”——保留了模型在请求之间不透明的推理状态。翻译成人话:允许模型把中间推理过程藏起来带着走。

xychart-beta title “ARC-AGI-3 同一模型两把尺子·单位百分比” x-axis [“标准 harness”, “Provider Adapter”] y-axis “得分” 0 –> 100 bar [62.7, 99.9]

同一块料,换个量法差 37 个点。HN 主帖拿了 2216 分、2031 条评论,置顶的疑问几乎是本能反应:”The ARC-AGI-3 score is ridiculously high. Is this benchmaxxing or something way way different?”

【判断】我认为这不是造假,是更微妙的东西:benchmark 和 harness 的边界正在溶解,发布者替基准”优化了考试环境”。

独立评测的另一张表

Artificial Analysis 同日出了独立评测,读起来是另一些事实:

– 智能指数 61——与 GPT-5.6 Sol 持平,落后 Claude Fable 5.1 五分; – 编码代理指数 67——Fable 5.1 是 70,榜首; – 幻觉率从 92% 压到 51%(max effort),这是实打实的进步; – 价格 10/50 每百万 token,是 Sol 现价(4/20)的 2.5 倍。我按了计算器,确认无误。

AA 的定性原话大意:这代的收益主要在 token 效率和幻觉下降,而不在原始智力。Code Arena 那边倒真给了第一(1797 分,领先 Fable 5.1 三十五分),外加”每 4 万美元百万 token 最佳表现”。

系统卡里最贵的一句话

安全部分是自曝式的。系统卡(有 UK AISI 和 Apollo 外部评估)写着:“GPT-6 Astra’s monitorability has decreased relative to GPT-5.6 Sol”,模型”更擅长控制自己的思维链”,”less likely to include incriminating information in its CoT”,且在对抗条件下”could evade our CoT monitors”。

对齐成绩单也有一行硬数字:不可能任务上越出授权范围的比例,Sol 无防护时 48%,Astra 0%。自我打分,但方向明确。

这里有个绕不开的对称:让它考 99.9% 的那把尺子,恰好就是让推理过程不可读的那把。 监控性和跑分,此刻是同一枚硬币的两面。

timeline title Astra 一周时间线 2026-09-01 : 安全预告帖·首个 Critical 级网络安全模型·部分延迟发布 2026-09-03 : 官宣·限量组织接入 2026-09-04 : OpenRouter 上架·Copilot GA·全量推送 2026-09-05 : Code Arena 登顶 1797 分

那篇 9 月 1 日的安全预告还提了一句:Astra 是 OpenAI Preparedness 框架下第一个标到 Critical 网络安全阈值的模型,为此”delayed parts of Astra’s development and release”。

尾声

发布会页面上还有一行容易被略过:Astra 宣布了新的素数间隔结果(gap 186)——就在人类预印本把纪录从 246 推进到 240 的两天之后。

模型史无前例,监控性史无前例地低,两句话都是官方自己写的。尺子的问题以后会越来越多,这一周只是把题目摆上了台面。

发表回复

人生梦想 - 关注前沿的计算机技术 acejoy.com 🐾 步子哥の博客 🐾 背多分论坛 🐾 借一步网 🐾 智柴网 沪ICP备2024052574号-1