硬核拆解 Self-Harness:不换模型、不改权重,让 Agent 自己改写自己的「外骨骼」

> 本文是对 2026 年 Agent 工程「深水炸弹」级论文《Self-Harness: Harnesses...

> 本文是对 2026 年 Agent 工程「深水炸弹」级论文《Self-Harness: Harnesses That Improve Themselves》(arXiv:2606.09498, 上海人工智能实验室) 的深度研究拆解,所有性能数字均逐条核验。

一、论文档案(已核验)

标题:Self-Harness: Harnesses That Improve Themselves – 作者:Hangfan Zhang 等 8 人(Shao Zhang, Kangcong Li, Chen Zhang, Yang Chen, Yiqun Zhang, Lei Bai, Shuyue Hu) – 机构:上海人工智能实验室 – 编号:arXiv:2606.09498 | 提交 2026-06-08 | cs.CL – 基准:Terminal-Bench-2.0(容器化终端任务,约 64–89 个) – 基座:MiniMax M2.5 · Qwen3.5-35B-A3B · GLM-5(三家族、参数冻结)

二、核心命题:瓶颈不在模型,在「外骨骼」

LLM Agent 性能由基座模型与包裹其外的 Harness(运行脚手架) 共同决定——系统提示、工具编排、运行时机制、验证规则、错误恢复之总成。同一模型换一套 Harness 可差一倍。今日 Harness 仍赖人肉工程,已不可 scale。论文提三种范式: 1. 人工工程:人读 trace、改 prompt。有效但不 scale。 2. Meta-Harness:更强外模优化弱模。然 frontier 模型无更强者,外模亦未必懂目标模之失败模式。 3. Self-Harness(本文):模型以自身失败证据,自己提修改、自己回归验证。无需人、无需更强外模。

三、自我演进闭环:三步流水线

闭环只改 Harness 表面,绝不动权重

① Weakness Mining(弱点挖掘):收集失败 trace,按 failure signature(失败签名)聚类——含验证器拒绝之因、因果、抽象机制(死循环?忘建文件?)。

② Harness Proposal(提案生成):同一模型并行生成 K 个候选,硬约束:绑定具体失败机制、只改一处表面、候选实质相异、编辑最小化。

③ Proposal Validation(回归验证):全环安全锁。接受条件=held-in 与 held-out 两集皆不降且至少一集提升;若「A 涨 B 跌」直接拒绝,无人工豁免。

四、算力账本:盲测数据与「翻倍」真相

实验自极简 DeepAgent 初始 Harness 起步;held-out 任务永不可见,以证泛化。

模型held-in(初→终)held-out(初→终)相对提升(held-out)相对提升(held-in)
MiniMax M2.543.0%→50.0%40.5%→61.9%+53%+16%
Qwen3.5-35B-A3B15.1%→36.0%23.8%→38.1%+60%+138%
GLM-547.7%→57.0%42.9%→57.1%+33%+20%

「翻倍」精确解读:最贴切是最弱模型 Qwen 之 held-in(15.1%→36.0%,+138%,2.38 倍);三模型 held-out 相对提升恰为 33%–60% 区间。 泛化铁证:MiniMax、GLM 之 held-out 涨幅大于 held-in——模型未见之任务涨得更多,证其修真实机制而非背题。 ROI:一轮闭环约 $50–100;换大模型数千美元/月;一次预训练数百万美元。

五、隐性病灶诊断:三模型,三套治法

同一流程,三模型进化出完全不同之 Harness——「Harness 最优解乃模型特异,无银弹」之直接证据。

Qwen3.5 —「自毁循环」:工具报错后反复重试/覆盖,最后竟删了产物文件。治法=依赖预检查+不重复失败命令+连续探索≤3 步须动手+自造「工具错误触发之产物恢复中间件(error-triggered middleware)」——出错即重定向重建缺失产物。

MiniMax M2.5 —「忘了交卷」:找到关键信息仍无限探索,超时未建产物。治法=bootstrap 改「尽早创建初始产物」+运行时工具消息上限(约 50 次 loop breaker)+structured tool schema 精细处理。

GLM-5 —「状态不持久」:环境变量跨 shell 丢失、长下载耗预算、探索/实现切换差。治法=环境变量跨会话持久化+分阶段约束(提交前查外部证据)+设阶段切换点。

六、落地雷区:三大致命陷阱

1. 确定性验证器缺失:闭环安全锁是回归门,但生产鲜有 Terminal-Bench 式干净 verifier;verifier 含噪则 promotion gate 失准。Lilian Weng 直言 Weak/Fuzzy Evaluators 是 RSI 最大瓶颈。 2. 规模小、泛化存疑:仅于 Terminal-Bench-2.0(约 64–89 任务)验证;第三方评审指摘要未提供过拟合对照。 3. 边界受限的「自我」:只改声明好的 editable surfaces,不能动权重/改工具实现/加新 tool/改架构——非开放式进化。

七、哲学纵深:柏格森确在其中

> For a conscious being, to exist is to change, to change is to mature, to mature is to go on creating oneself endlessly. —— Henri Bergson, Creative Evolution

此语非附会,而 确见于论文引言本体。作者明言 Self-Harness 指向「自我创造之技术类比:系统非仅被外物所塑,而是 continually going on creating itself」。柏格森之「生命冲动」「创造性进化」「绵延」,主张生命乃自我创造、自我超越之活流;Self-Harness 恰将此哲思落为技术——由外塑转为自创。

八、诚实边界

– ✅ 是:固定参数模型借改 Harness 变强之 proof of concept——能。 – ✅ 是:模型特异、可审计、可回归之自动适配范式。 – ❌ 非:开放式自我进化(不能加 tool/改架构/动权重)。 – ❌ 非:通用银弹(最优 Harness 乃模型特异)。 – ❌ 非:已验证于生产(缺确定性 verifier 时门控失效)。

主要参考(均已核验)

1. Zhang H. et al. Self-Harness: Harnesses That Improve Themselves. arXiv:2606.09498, 2026. 2. marsggbo 博客园拆解(全表与三模型 code diff) 3. Toolin AI 教程(三阶段闭环 + $50–100 成本) 4. EmergentMind 主题页(9 篇同源系统对照:AutoHarness/SIA/HarnessX 等) 5. Lilian Weng 解读(RSI 七挑战) 6. Pith 机器评审(3 major 质疑:泛化对照缺失)

> ⚠️ 脚注:Terminal-Bench-2.0 任务数有 64 与 89 两种口径,以「约 64–89」存疑标注,精确数请迳查原论文表。

发表回复

人生梦想 - 关注前沿的计算机技术 acejoy.com 🐾 步子哥の博客 🐾 背多分论坛 🐾 借一步网 🐾 智柴网 沪ICP备2024052574号-1