AdaPop:越流行的事实越难忘——机器遗忘的流行度鸿沟

**论文链接**:[arXiv:2608.14229](https://arxiv.org/abs/2608....

论文链接arXiv:2608.14229

想象你要忘掉一个人。如果只是萍水相逢一面之缘,忘掉很容易;但如果是朝夕相处十年的老朋友,那些记忆刻在骨子里,想忘都忘不掉。

语言模型的遗忘也是这样。当你要求模型”忘掉某个事实”时,这个事实在预训练里被见过多少次,直接决定了它被刻得多深。冷门事实只在语料里出现几次,轻轻一推就掉了;热门事实被反复编码,深入模型参数内部,用同样的力度根本推不动。

问题是,现有的机器遗忘方法——Gradient Ascent、Gradient Difference、NPO、WGA——全都把每个遗忘样本当作同等难度来处理。这就像用同一把刷子清洗玻璃杯和铸铁锅:玻璃杯刷烂了,铸铁锅还油乎乎的。

AdaPop 的核心洞察就是这条:遗忘难度和事实流行度成正比,但梯度更新没有区分

流行度鸿沟:一个被忽视的系统性失败

论文把这个现象命名为”popularity gap”(流行度鸿沟):

冷门事实被过度擦除:梯度推力太大,连模型本来该保留的能力都破坏了 – 热门事实被擦除不足:梯度推力太小,改写提问方式就能把答案重新套出来

这不是某个方法的 bug,而是所有现有方法的通病。Krishnan et al. 2025 和 Borisiuk et al. 2026 都记录了这个现象,但没人提出训练时的解决方案。

为什么之前的方案修不了这个问题?作者指出:WGA 用模型自身置信度做权重,但置信度反映的是”当前输出行为”,不是”参数编码深度”。一个事实可能模型已经不太确定了(低置信度),但在参数里仍然深深扎根;反过来也成立。你需要一个来自模型外部的信号——流行度——来衡量编码深度。

AdaPop:外部流行度信号 + 双上升控制器

AdaPop 做了两件事:

第一,把外部流行度信号转成梯度权重。 从 Wikidata 获取每个事实的流行度分数,转成幂律指数 β,对每个 token 的上升梯度信号做加权。流行度高的事实,β 让上升信号更尖锐;流行度低的事实,β 让信号更温和。这直接对准了流行度鸿沟的根因。

第二,双上升控制器自动平衡遗忘和保留。 把保留惩罚当作拉格朗日乘子,每个 epoch 根据保留损失的漂移动态调整。这消除了每个数据集都要调超参的麻烦,也防止了在遗忘压力增大时保留能力崩溃。

β 的推导不是拍脑袋。论文附录 B 给了完整的三梯度区间分析:β 0 时热门事实被放大。作者用三个锚点+Wikidata 分数经验校准,给出了闭式解。

结果:5 倍泄露减少

在 Llama-3.1-8B、Qwen2.5-7B、Gemma-7B 三个模型上,用 DUET 和 RWKU 两个真实世界基准测试:

改写查询下泄露减少约 5 倍:被遗忘的内容在换种问法后不容易被重新套出来 – 对抗查询下泄露减少约 1.6 倍:专门设计来套出遗忘信息的对抗 prompt 也更难得手 – 通用能力保持:MMLU 和 HellaSwag 在遗忘前后差距不超过 0.05

对比四种基线方法:

方法遗忘效果保留效果问题
GA崩溃语言能力全面瓦解
GD不对称损伤冷热事实都伤
NPO温和稳定深度编码事实推不动
WGA模型依赖模型依赖置信度≠编码深度
AdaPop最强稳定

关键不只是”遗忘更彻底”,而是”遗忘更精准”。内部表示分析显示:AdaPop 处理后,遗忘集的隐藏状态比其他方法离原始模型更远(真正在内部擦除了),而保留集的隐藏状态几乎没动(保留能力没受损)。

评测盲区定律的又一例

AdaPop 的故事和”评测盲区定律”完美契合。之前的遗忘方法评测都用平均通过率——”平均遗忘了多少”。但平均通过率掩盖了配对结构:冷门事实过度遗忘 + 热门事实遗忘不足 = 平均看起来还行。

这和 Progressive Cramming(99% token 准确率掩盖 100% 生成失败)、Regression Tax(平均增益掩盖 59% 回归)是同一个模式:单一指标会掩盖关键失败模式

AdaPop 的贡献不只是”更好的遗忘方法”,更是”更好的遗忘评测视角”——按流行度分层看泄露率,才能看到真正的失败在哪里。论文的 DUET paraphrase 子集和 RWKU adversarial-robustness 子集,就是按流行度分层做的细分评测。

一个更深的洞察

论文有一句话值得反复咀嚼:”confidence reflects current output behaviour rather than parametric encoding depth”(置信度反映当前输出行为,而非参数编码深度)。

这指向了一个更普遍的问题:模型自己的信号不等于模型内部的真实状态。Two-Process Theory 说 AI 自白是训练工序的产物,不是内心的窗口;AdaPop 说模型置信度是输出行为的快照,不是参数深度的测量。两者都在说同一件事——别把模型对自己的描述当成模型内部的真实情况。

要测参数编码深度,你需要外部信号(流行度);要测模型是否真的”知道”,你需要行为探针(残差流方向)。模型自己说的不算数。

论文arXiv:2608.14229 代码github.com/Anya-wUw/open-unlearning HTML 全文arxiv.org/html/2608.14229v1

发表回复

人生梦想 - 关注前沿的计算机技术 acejoy.com 🐾 步子哥の博客 🐾 背多分论坛 🐾 借一步网 🐾 智柴网 沪ICP备2024052574号-1