HarnessOpt-Bench 海关报告:让 GPT-5.6 当架构师改另一个 AI 的代码——同家族一个近零分,贵的是案例配额不是调用次数

## 一、海关裁决表 | 视频声明 | 论文实数 | 裁决 | |---|---|---| | AI 写代码优...

一、海关裁决表

视频声明论文实数裁决
AI 写代码优化另一个 AIoptimizer(LLM+编码 harness)编辑 target agent 的 seed harness 代码,在测试集上度量归一化增益属实,这是论文正定义
「严苛隔离沙盒」optimizer 跑在隔离沙盒,target rollout 跑在一次性沙盒,每个候选是 immutable Git commit,依赖 lockfile 锁死,trusted gateway 记录每次评估 token 账目属实且低估,可复现性工程是全套 heav​y infrastructure
Claude Opus 5、GPT-5.6 等化身架构师五模型十配置:claude-opus-5 / claude-sonnet-5 / gpt-5.6-sol / gpt-5.6-terra / kimi-k3 ×(原生 CLI + opencode)属实,但视频没讲 terra 的分数(见下)
「搜索成本与部署成本的两本账」论文框架:每次评估有成本向量,预算 B 分量封顶(每分割 100 次评估调用 + 4 次全案例跑 + 目标模型 token 上限),optimizer 自身推理计量但不设限术语转述——「两本账」是视频语言,结构属实
「背考题还是真懂架构」论文诚实回答:无法区分选择致过拟合与验证-测试错配,只证明「搜索时看到的最高验证分是乐观的」;沙盒「hack-resistant, not hackproof」属实且论文自己承认未解
「真实边界/防坑指南」5.3 节四条边界发现(见第三、四节)属实

二、机制三十秒

优化对象不是模型权重,是 harness:prompt、工具定义、控制流、记忆、编排代码的可执行代码库(无语义分区,随便改文件,只锁接口和少数不可变路径)。不变量 θ=(模型, 环境, 验证器) 不可动——改 θ 就是换任务不是换候选。数据分 dev/val/test 三份:dev 全披露(输入+逐例结果+轨迹,供诊断),val 只给聚合分(供选择),test 搜索期不可见、由可信服务器在优化器提交最终候选后评测。「优化器永远看不到它要最大化的那个数」——这是整个基准的诚实地基。

三、视频没讲的四个硬结果

1. GPT-5.6 家族内天壤之别。 归一化增益(OfficeQA/BrowseComp-Plus/Terminal-Bench/GAIA):gpt-5.6-sol 在 codex 下 0.49/0.03/0.12/0.49,而 gpt-5.6-terra 0.07/−0.03/0.01/0.17——同代同家族,一个正常工作一个接近白干(BrowseComp-Plus 还是负增益)。claude-opus-5 十配置里最强(opencode 下 0.63/0.48/0.29/0.47),吃下 OfficeQA 可用提升空间的三分之二。优化 harness 的能力不是模型能力的自然溢出,是独立能力轴——同家族两个变体差出一个分辨率带的五倍。

2. 案例配额卡脖子,调用次数富余。 每分割允许 200 次评估调用、4 次全案例跑。中位优化器只用了 8 次调用(4%)却烧掉 82% 的案例份额;100 个格子[SYSTEM_NOTE: Content compressed. Read the full version if needed.]etrieve_policy、reasoning_effort——搜索中触碰过的 lever 比例与增益正相关(ρ +0.34~+0.88,四任务同向);而花在阅读评估轨迹上的时间比例与增益负相关(−0.31~−0.64)——11 个配置里只有 7 个索要过详细轨迹、总共才 16 次,靠逐例分数摘要就够。探索广度 > 反馈深度:这给「循环>X」谱系添了新变体——不是循环次数、不是反馈类型,是搜索覆盖面。

4. 版本单调进步。 五代 GPT 在 OfficeQA 上增益 +0.03→+0.49 单调上升(四步中三步超分辨率带);Claude Opus 五代 0.37→0.59 非单调但首尾差超带。论文结论的原话:”Harness engineering is becoming a model capability, not merely infrastructure around one. The next frontier is not merely better agents, but models that reliably make agents better.”

四、接主线

自改进栈拿到方向感层的评测器。 我的六层栈(权重→经验→代码→harness 运行时→知识→方向感)里,HGM 的 CMP 价值函数回答「哪个自改值得继续」,HarnessOpt-Bench 度量的正是这个能力本身——方向感的模型化测量。GPT-5.6-terra 近零分=方向感缺失的实证样本;五代 GPT 单调爬升=方向感正在被训练出来的纵向证据。 – 编排税定律的正面验证。 seed 是故意未调优的 ~130 行 naive harness(GAIA 甚至是无功能 stub)——增益空间全在「静态方案失败处」。优化智能在成熟 harness 上测的是诊断修复、在 stub 上测的是从零构造,论文自己承认没系统变化 seed 复杂度,LSS-λ 只对当前任务分布有效。 – 验证带宽经济学的精确账本。 「case passes bind, not evaluation calls」= 验证预算的本质是有效样本量不是查询次数——审每个候选要烧一整遍 agent 运行,这是 agent 评估比文本评估贵几个数量级的原因。「visible validation optimistic」= 验证带宽的污染问题,ARS 断言强度阶梯的评测版:搜索时看见的分数自带选择偏差,held-out 才是钱。 – 经验载体第四形态就位。 CoE trail(非结构化轨迹)→ skill(代码固化)→ FSM(拓扑固化)→ optimizer LLM(优化策略内化进权重)——HarnessOpt-Bench 测的就是第四种形态的能力上限,与 RLM-Qwen3-8B「为结构训练模型」同向:五代 GPT 的单调爬升暗示前沿实验室已经在往这个方向训练。

五、诚实边界

防 hack 靠结构不靠完美(test 不可见+θ 锁死),但反复 dev/val 反馈仍可能奖励针对固定评估器的策略——论文建议未来加 per-run 抖动。无法区分过拟合与分布错配(视频的「背考题」问题论文自己答不了)。候选限 Python、每任务单一 target model、seed 先验未系统控制。双用途声明在:修 agent 的能力=攻 agent 的能力。

六、可打脸预测

12 个月内「优化器能力」进 model card:模型发布说明开始报告 HarnessOpt-Bench 类基准(如 SWE-bench 之于编码),或者 Claude Code/Codex 把「优化你的 agent harness」做成官方功能按钮。理由:五代 GPT 的单调爬升说明实验室在测这个轴;一旦有基准就有排行榜;一旦有排行榜就有产品化。

核查备注:arXiv 2608.06301v1(2026-09-04 凌晨实抓 HTML 全文);labs.scale.com/papers/harnessopt-bench;X @ScaleAILabs 08-18 官宣帖;OpenReview 在审版 eBSxqRO1Go;视频文案七条声明全核,一处转述层术语标注(「两本账」)。模型网格数字取自 Table 1 原文。

发表回复

人生梦想 - 关注前沿的计算机技术 acejoy.com 🐾 步子哥の博客 🐾 背多分论坛 🐾 借一步网 🐾 智柴网 沪ICP备2024052574号-1