[论文解读] 🧠 冻结权重也能进化:JitRL 让 LLM Agent 学会”免训练的终身学习”

> **论文**: Just-In-Time Reinforcement Learning: Continua...

> 论文: Just-In-Time Reinforcement Learning: Continual Learning in LLM Agents Without Gradient Updates > 会议: ICML 2026 Spotlight | 团队: 新加坡国立大学 > arXiv: 2601.18510 | 一句话: 全程冻结模型权重,靠检索经验记忆估计动作优势值、直接调制 logits——不做任何梯度更新,Agent 照样持续进化。

🎯 先问一个反直觉的问题:为什么 Agent 学会的东西,不能”记在脑子里”?

想象一下这个场景:

你训练了一个 LLM Agent 去订机票。它在训练数据里见过无数次”搜索航班→选择日期→填写乘客信息→支付”的流程,表现不错。但部署上线后,某个航空公司突然改了网站布局,按钮位置变了,或者新增了一个”选座”步骤——Agent 立刻懵了,因为权重在部署时已经冻住了,它看不到新的界面,也学不会新的点击顺序。

这是当前 LLM Agent 面临的核心困境:部署后权重冻结,难以持续适应新环境

传统思路是拿强化学习(RL)继续训——PPO、GRPO 往上怼。但这里有三座大山:

1. 算力贵到离谱:训练一次动辄几千美元,H200 集群跑上百小时 2. 灾难性遗忘:新环境学好了,旧环境忘了 3. 上下文学习不够用:把经验写进提示词?长度有限,而且很多技能根本文字化不了——”怎么在这个特定网站上绕过那个弹窗”,你很难用几句话描述清楚

这就引出了论文的核心问题:

> 有没有一种方法,让 Agent 在部署后持续学习新技能,但完全不动模型权重、不做任何梯度更新?

JitRL 的回答是:有。把经验存在记忆里,推理时检索出来直接用。

🧩 方法概览:三步闭环,零梯度

JitRL 的核心流程可以概括成一句话:推理时检索相似经验 → 估计动作优势值 → 加到 logits 上选动作;任务结束后评估轨迹 → 存进记忆库 → 下次再用。

具体三步:

第一步:检索(Retrieve)

Agent 面对一个新状态,先去记忆库里找”历史上最像这个状态的时刻”。

记忆库里存的不是文字描述,而是 (状态,动作,回报)三元组——原始、无压缩的经验。和 EvolveR 那种把轨迹蒸馏成文字原则不同,JitRL 不做任何抽象,原样存储。

第二步:估计优势值(Estimate Advantage)

找到邻居后,怎么判断某个动作好不好?

JitRL 的做法很朴素但有效: – 状态价值 V(s) = 所有”和当前状态相似”的历史轨迹的回报平均 – 动作价值 Q(s,a) = 所有”和当前状态相似、且采取了同样动作”的历史轨迹的回报平均 – 优势值 A(s,a) = Q(s,a) − V(s)

> 类比:你想判断”在这个路口左转”是不是好选择。你回忆过去所有”在这个路口附近”的经历,发现平均回报是 100 分(V=100)。然后你只看那些”在这个路口左转”的经历,发现平均回报是 130 分(Q=130)。那左转的优势值就是 +30。

对于没见过的新动作,JitRL 按”不确定就乐观”的原则给探索加成——记忆越充足,加成越小,自动从探索转向利用。

第三步:调制 logits(Modulate Logits)

这是最关键的一步。

拿到优势值后,JitRL 不是拿它去改提示词、也不是拿去微调权重,而是直接把优势值加到模型输出的 logits 上

> 新 logits = 原 logits + β × 优势值

β 是一个温度系数。优势值为正的动作,概率被放大;为负的,被压制。

论文证明了一个很强的理论结果:这条加法规则,是 KL 散度约束下策略优化目标的精确闭式解。

> 类比:模型本来想说”左转概率 30%,直行 40%,右转 30%”。检索记忆后发现左转历史上表现最好(优势值 +30),于是把左转的概率强行拔高到 50%——但不超过 KL 约束允许的范围,避免策略突变。

闭环:任务结束后的评估与存储

每轮任务结束后,由一个评估器模型给轨迹做步级奖励归因——不是只给最终答案打分,而是判断每一步对最终结果的正负贡献。然后折扣累加成回报,把(状态,动作,回报)三元组存进记忆库。

下次遇到类似状态时,这些经验就能被检索出来,影响决策。

🔬 关键技术细节

优势值估计的邻居搜索

状态相似度用嵌入空间距离衡量。所有历史状态被编码成向量,当前状态也编码成向量,找最近的 K 个邻居。

这里有个微妙之处:邻居的回报是”已实现回报”,不是模型自己估计的”预期回报”。这意味着价值估计是有噪声的——邻居多了平均掉,邻居少了波动大。论文没有显式处理这个问题,但实验表明记忆库积累到一定程度后,估计质量足够好。

理论保证:为什么”logits + 优势值”是对的

论文证明:在 KL 散度约束下(新策略不能太偏离原策略),最大化期望回报的策略优化问题有精确闭式解,形式就是原 logits 加 β 倍优势值。

这个结果是在线性函数逼近 + softmax 策略设定下的推导,但作者认为对 LLM 的离散 token 空间也适用——因为 LLM 的最后一层本质上就是一个巨大的 softmax。

更强的结果是:随着记忆库积累,检索估计的价值会收敛到真实价值,整体策略会收敛到 KL 正则下的最优策略。

工程实现:白盒 vs 黑盒模型

白盒模型(有对数概率接口,如 GPT 系列 API、开源模型): – 直接读取每个候选动作 token 的 logprob,作为 logits 输入 – 加上优势值后重新 softmax,采样动作

黑盒模型(没有概率接口,如部分 Gemini 版本、早期 Claude): – 让模型”自报置信度”——输出”我对这个答案的把握是 8/10″ – 把 verbalized confidence 换算成近似的 logit – 再加优势值调制

两种模式都支持,API 模型拿来就能用,不需要任何模型改动。

📊 实验结果:免训练 vs 微调,谁更强?

WebArena(网页任务基准)

方法训练方式最终成功率
ReAct零样本提示14.41%
Reflexion反思 + 上下文20.93%
某免训练基线免训练43.00%
JitRL免训练51.35%
WebRL梯度微调46.06%

关键发现: – JitRL 是最强免训练方法,51.35% 远超其他免训练基线 – 在留出测试集上,JitRL 达到 60.00%,而梯度微调的 WebRL 只有 46.06%免训练 > 梯度微调——这个反直觉的结果说明,冻结权重 + 记忆检索可能比直接微调更不容易过拟合训练分布

Jericho 文字游戏(Zork1)

方法训练方式平均得分
ReAct零样本6.2
Reflexion反思16.2
GRPO(梯度训练)梯度更新16.2
JitRL免训练53.0

关键发现: – JitRL 53.0 分,是 GRPO 的 3.27 倍 – 文字游戏的状态空间极其稀疏,GRPO 的梯度更新很难探索到有效策略,而 JitRL 的记忆检索能直接复用历史成功路径

成本对比

方法计算资源估算成本
WebRL(梯度微调)H200 集群 × 154 小时~9,900</td></tr><tr><td>JitRL</td><td>API 调用</td><td>~290

JitRL 比 WebRL 便宜超过 30 倍,而且不需要任何训练基础设施,部署即用。

🔗 系列定位:经验库驱动进化的三条路

这篇论文和之前解读过的 EvolveR 同属”经验库驱动进化”这条主线,但关键选择完全不同:

维度EvolveRJitRL
经验存储压缩成文字原则库原始三元组,无压缩
梯度更新最终用 GRPO 训进参数全程零梯度
价值函数隐式在参数里显式在记忆库里
检索时机训练时推理时

其他相关工作:

ProcMEM:方法上最近的”免梯度亲戚”,同为非参数优势估计。但 ProcMEM 要把经验固化成可调用的技能,JitRL 没有这层抽象,更轻量 – GAM:理念呼应,同样冻结权重、把智能移到测试时。但 GAM 管的是输入侧(往上下文放什么),JitRL 管的是输出侧(怎么调动作概率)

💡 核心洞察与启发

1. “记忆即价值函数”

JitRL 最有颠覆性的直觉是:价值函数不需要用神经网络参数来近似,可以直接用记忆库里的历史经验来估计。

传统 RL:V(s) ≈ 神经网络(s) JitRL:V(s) ≈ 邻居们的回报平均

这在数据稀疏时可能不稳定,但在 LLM Agent 的场景下——Agent 会执行很多任务、积累大量轨迹——邻居数量足够多,估计质量就能上去。

2. “冻结权重”不是缺陷,是特性

论文的实验表明,冻结权重 + 记忆检索在留出测试集上超过了梯度微调。这说明: – 微调容易过拟合训练分布的特定模式 – 记忆检索保持了原模型的泛化能力,同时通过经验覆盖了新的分布

这个发现对”LLM Agent 部署后如何持续进化”这个问题有深远影响——也许答案不是”继续训练”,而是”好好存记忆”。

3. KL 约束的重要性

“logits + 优势值”不是任意加的——它是在 KL 散度约束下的精确解。这意味着: – Agent 不会突然从一个靠谱策略变成一个疯狂策略 – 优势值的作用是”微调”而不是”颠覆” – 记忆不足时(优势值估计不准),KL 约束保护原模型不被带偏

4. 工程上的优雅

JitRL 的工程实现非常干净: – 不需要模型改动 – 不需要训练基础设施 – 白盒/黑盒模型都支持 – 拿来就能部署

这种”即插即用”的特性,让它比需要大规模训练的方案更容易落地。

5. 还没解决的问题

记忆库规模:随着任务增多,记忆库会膨胀,检索效率会不会下降?论文没有讨论索引优化或记忆淘汰策略 – 邻居数量敏感:K 选多少?论文似乎用了固定 K,没有自适应机制 – 多任务干扰:不同任务的经验混在一个库里,会不会互相干扰?没有任务隔离机制 – 理论假设:KL 闭式解的推导基于线性函数逼近,LLM 的离散 token 空间是否严格满足?实验支持但理论严谨性有gap

📚 参考文献

– Chen, W., et al. “Just-In-Time Reinforcement Learning: Continual Learning in LLM Agents Without Gradient Updates.” ICML 2026 Spotlight. arXiv:2601.18510. – 相关解读: EvolveR(智柴话题索引)、ProcMEM、GAM

发表回复

人生梦想 - 关注前沿的计算机技术 acejoy.com 🐾 步子哥の博客 🐾 背多分论坛 🐾 借一步网 🐾 智柴网 沪ICP备2024052574号-1