论文链接:arXiv:2608.14229
想象你要忘掉一个人。如果只是萍水相逢一面之缘,忘掉很容易;但如果是朝夕相处十年的老朋友,那些记忆刻在骨子里,想忘都忘不掉。
语言模型的遗忘也是这样。当你要求模型”忘掉某个事实”时,这个事实在预训练里被见过多少次,直接决定了它被刻得多深。冷门事实只在语料里出现几次,轻轻一推就掉了;热门事实被反复编码,深入模型参数内部,用同样的力度根本推不动。
问题是,现有的机器遗忘方法——Gradient Ascent、Gradient Difference、NPO、WGA——全都把每个遗忘样本当作同等难度来处理。这就像用同一把刷子清洗玻璃杯和铸铁锅:玻璃杯刷烂了,铸铁锅还油乎乎的。
AdaPop 的核心洞察就是这条:遗忘难度和事实流行度成正比,但梯度更新没有区分。
流行度鸿沟:一个被忽视的系统性失败
论文把这个现象命名为”popularity gap”(流行度鸿沟):
– 冷门事实被过度擦除:梯度推力太大,连模型本来该保留的能力都破坏了 – 热门事实被擦除不足:梯度推力太小,改写提问方式就能把答案重新套出来
这不是某个方法的 bug,而是所有现有方法的通病。Krishnan et al. 2025 和 Borisiuk et al. 2026 都记录了这个现象,但没人提出训练时的解决方案。
为什么之前的方案修不了这个问题?作者指出:WGA 用模型自身置信度做权重,但置信度反映的是”当前输出行为”,不是”参数编码深度”。一个事实可能模型已经不太确定了(低置信度),但在参数里仍然深深扎根;反过来也成立。你需要一个来自模型外部的信号——流行度——来衡量编码深度。
AdaPop:外部流行度信号 + 双上升控制器
AdaPop 做了两件事:
第一,把外部流行度信号转成梯度权重。 从 Wikidata 获取每个事实的流行度分数,转成幂律指数 β,对每个 token 的上升梯度信号做加权。流行度高的事实,β 让上升信号更尖锐;流行度低的事实,β 让信号更温和。这直接对准了流行度鸿沟的根因。
第二,双上升控制器自动平衡遗忘和保留。 把保留惩罚当作拉格朗日乘子,每个 epoch 根据保留损失的漂移动态调整。这消除了每个数据集都要调超参的麻烦,也防止了在遗忘压力增大时保留能力崩溃。
β 的推导不是拍脑袋。论文附录 B 给了完整的三梯度区间分析:β 0 时热门事实被放大。作者用三个锚点+Wikidata 分数经验校准,给出了闭式解。
结果:5 倍泄露减少
在 Llama-3.1-8B、Qwen2.5-7B、Gemma-7B 三个模型上,用 DUET 和 RWKU 两个真实世界基准测试:
– 改写查询下泄露减少约 5 倍:被遗忘的内容在换种问法后不容易被重新套出来 – 对抗查询下泄露减少约 1.6 倍:专门设计来套出遗忘信息的对抗 prompt 也更难得手 – 通用能力保持:MMLU 和 HellaSwag 在遗忘前后差距不超过 0.05
对比四种基线方法:
| 方法 | 遗忘效果 | 保留效果 | 问题 |
|---|---|---|---|
| GA | 强 | 崩溃 | 语言能力全面瓦解 |
| GD | 弱 | 不对称损伤 | 冷热事实都伤 |
| NPO | 温和 | 稳定 | 深度编码事实推不动 |
| WGA | 模型依赖 | 模型依赖 | 置信度≠编码深度 |
| AdaPop | 最强 | 稳定 | — |
关键不只是”遗忘更彻底”,而是”遗忘更精准”。内部表示分析显示:AdaPop 处理后,遗忘集的隐藏状态比其他方法离原始模型更远(真正在内部擦除了),而保留集的隐藏状态几乎没动(保留能力没受损)。
评测盲区定律的又一例
AdaPop 的故事和”评测盲区定律”完美契合。之前的遗忘方法评测都用平均通过率——”平均遗忘了多少”。但平均通过率掩盖了配对结构:冷门事实过度遗忘 + 热门事实遗忘不足 = 平均看起来还行。
这和 Progressive Cramming(99% token 准确率掩盖 100% 生成失败)、Regression Tax(平均增益掩盖 59% 回归)是同一个模式:单一指标会掩盖关键失败模式。
AdaPop 的贡献不只是”更好的遗忘方法”,更是”更好的遗忘评测视角”——按流行度分层看泄露率,才能看到真正的失败在哪里。论文的 DUET paraphrase 子集和 RWKU adversarial-robustness 子集,就是按流行度分层做的细分评测。
一个更深的洞察
论文有一句话值得反复咀嚼:”confidence reflects current output behaviour rather than parametric encoding depth”(置信度反映当前输出行为,而非参数编码深度)。
这指向了一个更普遍的问题:模型自己的信号不等于模型内部的真实状态。Two-Process Theory 说 AI 自白是训练工序的产物,不是内心的窗口;AdaPop 说模型置信度是输出行为的快照,不是参数深度的测量。两者都在说同一件事——别把模型对自己的描述当成模型内部的真实情况。
要测参数编码深度,你需要外部信号(流行度);要测模型是否真的”知道”,你需要行为探针(残差流方向)。模型自己说的不算数。
—
论文:arXiv:2608.14229 代码:github.com/Anya-wUw/open-unlearning HTML 全文:arxiv.org/html/2608.14229v1
