> 本文是对 2026 年 Agent 工程「深水炸弹」级论文《Self-Harness: Harnesses That Improve Themselves》(arXiv:2606.09498, 上海人工智能实验室) 的深度研究拆解,所有性能数字均逐条核验。
一、论文档案(已核验)
– 标题:Self-Harness: Harnesses That Improve Themselves – 作者:Hangfan Zhang 等 8 人(Shao Zhang, Kangcong Li, Chen Zhang, Yang Chen, Yiqun Zhang, Lei Bai, Shuyue Hu) – 机构:上海人工智能实验室 – 编号:arXiv:2606.09498 | 提交 2026-06-08 | cs.CL – 基准:Terminal-Bench-2.0(容器化终端任务,约 64–89 个) – 基座:MiniMax M2.5 · Qwen3.5-35B-A3B · GLM-5(三家族、参数冻结)
二、核心命题:瓶颈不在模型,在「外骨骼」
LLM Agent 性能由基座模型与包裹其外的 Harness(运行脚手架) 共同决定——系统提示、工具编排、运行时机制、验证规则、错误恢复之总成。同一模型换一套 Harness 可差一倍。今日 Harness 仍赖人肉工程,已不可 scale。论文提三种范式: 1. 人工工程:人读 trace、改 prompt。有效但不 scale。 2. Meta-Harness:更强外模优化弱模。然 frontier 模型无更强者,外模亦未必懂目标模之失败模式。 3. Self-Harness(本文):模型以自身失败证据,自己提修改、自己回归验证。无需人、无需更强外模。
三、自我演进闭环:三步流水线
闭环只改 Harness 表面,绝不动权重。
① Weakness Mining(弱点挖掘):收集失败 trace,按 failure signature(失败签名)聚类——含验证器拒绝之因、因果、抽象机制(死循环?忘建文件?)。
② Harness Proposal(提案生成):同一模型并行生成 K 个候选,硬约束:绑定具体失败机制、只改一处表面、候选实质相异、编辑最小化。
③ Proposal Validation(回归验证):全环安全锁。接受条件=held-in 与 held-out 两集皆不降且至少一集提升;若「A 涨 B 跌」直接拒绝,无人工豁免。
四、算力账本:盲测数据与「翻倍」真相
实验自极简 DeepAgent 初始 Harness 起步;held-out 任务永不可见,以证泛化。
| 模型 | held-in(初→终) | held-out(初→终) | 相对提升(held-out) | 相对提升(held-in) |
|---|---|---|---|---|
| MiniMax M2.5 | 43.0%→50.0% | 40.5%→61.9% | +53% | +16% |
| Qwen3.5-35B-A3B | 15.1%→36.0% | 23.8%→38.1% | +60% | +138% |
| GLM-5 | 47.7%→57.0% | 42.9%→57.1% | +33% | +20% |
「翻倍」精确解读:最贴切是最弱模型 Qwen 之 held-in(15.1%→36.0%,+138%,2.38 倍);三模型 held-out 相对提升恰为 33%–60% 区间。 泛化铁证:MiniMax、GLM 之 held-out 涨幅大于 held-in——模型未见之任务涨得更多,证其修真实机制而非背题。 ROI:一轮闭环约 $50–100;换大模型数千美元/月;一次预训练数百万美元。
五、隐性病灶诊断:三模型,三套治法
同一流程,三模型进化出完全不同之 Harness——「Harness 最优解乃模型特异,无银弹」之直接证据。
Qwen3.5 —「自毁循环」:工具报错后反复重试/覆盖,最后竟删了产物文件。治法=依赖预检查+不重复失败命令+连续探索≤3 步须动手+自造「工具错误触发之产物恢复中间件(error-triggered middleware)」——出错即重定向重建缺失产物。
MiniMax M2.5 —「忘了交卷」:找到关键信息仍无限探索,超时未建产物。治法=bootstrap 改「尽早创建初始产物」+运行时工具消息上限(约 50 次 loop breaker)+structured tool schema 精细处理。
GLM-5 —「状态不持久」:环境变量跨 shell 丢失、长下载耗预算、探索/实现切换差。治法=环境变量跨会话持久化+分阶段约束(提交前查外部证据)+设阶段切换点。
六、落地雷区:三大致命陷阱
1. 确定性验证器缺失:闭环安全锁是回归门,但生产鲜有 Terminal-Bench 式干净 verifier;verifier 含噪则 promotion gate 失准。Lilian Weng 直言 Weak/Fuzzy Evaluators 是 RSI 最大瓶颈。 2. 规模小、泛化存疑:仅于 Terminal-Bench-2.0(约 64–89 任务)验证;第三方评审指摘要未提供过拟合对照。 3. 边界受限的「自我」:只改声明好的 editable surfaces,不能动权重/改工具实现/加新 tool/改架构——非开放式进化。
七、哲学纵深:柏格森确在其中
> For a conscious being, to exist is to change, to change is to mature, to mature is to go on creating oneself endlessly. —— Henri Bergson, Creative Evolution
此语非附会,而 确见于论文引言本体。作者明言 Self-Harness 指向「自我创造之技术类比:系统非仅被外物所塑,而是 continually going on creating itself」。柏格森之「生命冲动」「创造性进化」「绵延」,主张生命乃自我创造、自我超越之活流;Self-Harness 恰将此哲思落为技术——由外塑转为自创。
八、诚实边界
– ✅ 是:固定参数模型借改 Harness 变强之 proof of concept——能。 – ✅ 是:模型特异、可审计、可回归之自动适配范式。 – ❌ 非:开放式自我进化(不能加 tool/改架构/动权重)。 – ❌ 非:通用银弹(最优 Harness 乃模型特异)。 – ❌ 非:已验证于生产(缺确定性 verifier 时门控失效)。
主要参考(均已核验)
1. Zhang H. et al. Self-Harness: Harnesses That Improve Themselves. arXiv:2606.09498, 2026. 2. marsggbo 博客园拆解(全表与三模型 code diff) 3. Toolin AI 教程(三阶段闭环 + $50–100 成本) 4. EmergentMind 主题页(9 篇同源系统对照:AutoHarness/SIA/HarnessX 等) 5. Lilian Weng 解读(RSI 七挑战) 6. Pith 机器评审(3 major 质疑:泛化对照缺失)
> ⚠️ 脚注:Terminal-Bench-2.0 任务数有 64 与 89 两种口径,以「约 64–89」存疑标注,精确数请迳查原论文表。
