从 8000 条 agent 轨迹压出 43 个状态:失败预测 AUROC 0.94,而行为拓扑住在 harness 不住在模型里

> 一份论文解读文案:从 LLM agent 执行轨迹提取有限状态机,一个 FSM 同时干四件事(工作流记忆/...

> 一份论文解读文案:从 LLM agent 执行轨迹提取有限状态机,一个 FSM 同时干四件事(工作流记忆/下一步预测/失败预测/运行时监控)。溯源:arXiv 2608.23670(2026-08-24 v1,Holistic AI × UCL × PUC-Rio,一作 Seonglae Cho),论文 HTML 全文实抓,OpenReview 有在审版本,作者配了 HF Space demo 站(无 GitHub 代码仓库)。文案数字逐条过海关——全数命中,这是继 AI Hero 零膨胀、Better Stack 负向加料之后,第三种高分形态:结构忠实且无漂移,唯一微口径:「Rank-AUROC 0.66 vs 随机 0.5」原文写作「vs 0.5 for flag-everything」(全标记基线,数值等于随机但表述不同,可接受)。

一、海关裁决表

文案声明原文实数裁决
无超参数线性时间构造,毫秒级"deterministic, hyperparameter-free construction…build in milliseconds";最大数据集 8,337 轨迹属实
一机四任务,不需单独训练"replacing four bespoke learned pipelines with one structural primitive"属实
失败预测 AUROC 0.94"held-out AUROC up to 0.94"(另有三个数据集因终态直接编码标签被诚实剔除,AUROC 1.000 不算数)属实
21 组对比 20 组胜 MLP/GRU/Transformer"on 20 of 21 pairs"属实
32% 进度早停、25% 排名 0.66"rank-AUROC 0.66…triggers early stopping at 32% completion"属实
比 RPNI 少 15–3036 倍状态,≥0.997 拟合"15–3,036× fewer states than RPNI at ≥0.997 fitness"属实
三步构造+右同余合并+singleton 过滤Step1 前缀树→Step2 按最后活动合并(A+1 类)→Step3 删只出现一次的转移(源状态唯一出边除外);§3.4 证明保拟合+确定性属实
同语料唯一输出,可复现拉满"a fixed training corpus yields a unique FSM, so re-extraction is exactly reproducible"(Theorem 3)属实

二、方法为什么成立:符号集有限是硬前提

agent 轨迹看着是自由文本流,但活动字母表只有 6–42 个符号(工具调用名/动作标签/命令类别)。三步法的每一步都在利用这一点:

1. 前缀树:所有轨迹插入 trie,每个唯一前缀一个状态——完美拟合但状态数 O(总轨迹长度) 2. 右同余合并:按「进入状态的那条边」的活动合并——所有以 bash 结尾的路径归为一个状态,最终 |A|+1 类。数学保证:合并完全保留拟合度(这是和 RPNI 最大的区别,RPNI 要搜索状态合并序列) 3. singleton 过滤:删语料中只出现一次的转移(除非它是源状态唯一出路)——一步去噪,也是全流程唯一损失拟合的地方(可直接测量)

关键的理论姿态藏在血统里:Gold 1967 定理说正例不可学习目标语言——RPNI/EDSM/L* 要负例或预言机,轨迹语料恰好只有正例。这篇的绕行方式是放弃恢复「生成语言」,只要「直接跟随闭包」:不追求完美恢复,追求够用恢复。理论上限换工程可行,40 年 grammatical inference 理论第一次被这样用到 agent 轨迹上。

三、摘要里最狠的一句(文案没提)

> “Behavioral topology thus appears shaped more by the deployment harness than by the LLM.”

证据:tau2-bench 三套件,4 个模型(GPT-4.1 / Claude 3.7 Sonnet / GPT-4.1-mini / o4-mini)的行为能被同一个 FSM 以完美拟合度回放。换模型,拓扑不换——决定行为结构的是工具集和环境规则,不是模型。跨模型迁移平均 AUROC 0.786(最强 GPT-4.1→o4-mini 0.950,最弱 o4-mini→Claude 0.544)。

这句话值得单独拎出来,因为它和本周两篇独立工作互证:

– 深模块篇(昨天):结构住在代码边界,不住在上下文描述里 – Prime Agent:harness 失败不变成模型失败——结构由 harness 承载 – 本篇:行为拓扑由 harness 塑造,不由 LLM 塑造

三样本指向同一件事:agent 的「可治理层」不在模型里,在模型外面。要约束、监控、预测 agent 行为,改模型是下策,改 harness(工具面+流程)是上策——因为行为的骨架就长在那里。

四、主线回接

1. 这是「接口丢结构」的逆操作。 十六验讲的都是结构穿过窄接口被拍扁;这篇做的是反向:轨迹(1D 序列)里被拍扁的直接跟随关系,用确定性算法重建出拓扑。与 Luna-TTS 严格同构——RVQ 网格被 AR 解码拍扁、block-causal 恢复拓扑;这里是行为拓扑被序列轨迹拍扁、右同余合并恢复拓扑。一个家族的两种逆问题。

2. 经验载体第三形态。 自改进栈的经验层已有两种形态:CoE trail(非结构化轨迹)和 skill(代码固化)。FSM 是第三种——经验的拓扑固化:8,337 条轨迹压成 43 个状态,有效维度≪表面维度的第四证(前三证:Metis 记忆/Mobius 稀疏激活/Mapping 流形)。而且它是唯一可以「整个装进监控面板」的形态——trail 装不进,skill 要执行才能看。

3. 验证带宽经济学的新地板。 LLM-as-judge 验证一条轨迹要花一次推理;FSM 监控一条运行=查转移表,成本趋零。32% 进度早停意味着每条注定失败的运行省 68% 算力——验证成本第一次坍缩到查表级别。失败预测信号也便宜得反直觉:不靠轨迹内容,靠 per-state 访问计数(SWE-agent 失败轨迹在 edit 工具环上平均绕 8.4 圈 vs 成功 5.1 圈——失败写在结构里,不在文本里)。

4. 神经符号的新方向。 SPAUN→SSP-SLAM→SSP-BO 三角都是「把符号结构给模型」;这篇是「从模型行为中提取符号结构」——箭头反了。神经产生行为,符号提炼行为,两者的接口就是轨迹语料。

五、诚实边界(论文自己承认的,必读)

FSM 接受的是直接跟随闭包,不是 agent 的生成语言:保持二元组统计的对抗性轨迹可以骗过重放检查(定理 3 的另一面)。随机单符号突变 77–100% 被拒,但精心构造的对抗样本不在防御范围内——监控器可绕,别当安全边界用 – 活动提取函数 φ 是数据集特定的,需要少量领域知识,全自动 φ 发现留给未来 – 跨模型迁移只在 tau2-bench 三套件上测过;跨架构、跨域迁移未验证 – 只对比了 AWM 一个记忆基线,ReasoningBank 等并发方法未比 – 无 GitHub 代码仓库(HF Space demo),复现要自己实现

六、可打脸预测

12 个月内主流 agent 观测平台(LangSmith / Langfuse / Braintrust 一类)会把 trace-to-FSM 做成内置面板——今天论文里的构造法 30 行代码就能实现(前缀树+合并+过滤,无超参数),失败预测特征是访问计数这种统计量,没有任何护城河。唯一的问题是平台愿不愿意暴露「你的 agent 行为其实只有 43 个状态」这个略显扎心的事实。

核查备注:论文 arXiv 2608.23670v1(2026-09-03 实抓 HTML 全文);OpenReview 在审版 openreview.net?id=1cprFkvFT0;demo 站 seonglae-agentstategraph.hf.space(Holistic AI / UCL / PUC-Rio,项目页标注 2026-06-30);GitHub 代码仓库未发现。文案四亮点+三技术要点全数原文命中,一处微口径(随机 0.5 vs flag-everything 0.5)。

发表回复

人生梦想 - 关注前沿的计算机技术 acejoy.com 🐾 步子哥の博客 🐾 背多分论坛 🐾 借一步网 🐾 智柴网 沪ICP备2024052574号-1