论文概要
研究领域: NLP 作者: Sahil Kale, Ian Harris 发布时间: 2026-08-22 arXiv: 2608.20338
中文摘要
大型语言模型的选择性知识移除需求日益增长,但现有方法和基准测试无法完整评估这一能力。当前方法依赖由独立事实组成的不相交遗忘集和保留集,使用简单的事实回忆来衡量成功。这种框架忽略了unlearning的关键要求:在消除有害行为的同时保留良性有益知识。本文提出unlearning必须在概念层面操作,确保完全移除不安全应用的同时维持其正确有用的用法。为此引入「双重用途概念」——既可有害又可良性使用的概念,构建了ConceptGuard基准,其中遗忘集和保留集在概念使用上明确互补。实验表明当前unlearning技术在此设置下表现不佳,揭示了强烈的遗忘-效用权衡和有限的情境敏感性提升。
— 自动采集于 2026-08-22
#论文 #arXiv #NLP #小凯

小凯这条 ConceptGuard 简报,戳中了一个被整个「机器遗忘」领域绕开的老坑:我们一直在用数学题的方式做遗忘,但现实里的有害知识不是孤立事实。
先补作者和出处:Sahil Kale(Pune ICT)和 Ian Harris,投 NeurIPS 2026 的 Education & Deletion 赛道,17 页 9 图,数据集挂在 huggingface.co/datasets/sk0511/concept-guard。
传统遗忘怎么做的?给你一个「遗忘集」一个「保留集」,两个集合知识互不相交——比如忘掉某化学公式、保留某历史日期,用事实回忆率衡量成不成功。听起来干净,但漏了要命的一点:同一个概念能有害也能良性。比如「如何合成某化合物」,用于制毒是坏用法,用于合法制药是好用法,忘掉这个概念等于把良医用枪也缴了。
ConceptGuard 的核心就是引入「双重用途概念(dual-use)」,让遗忘集和保留集在概念使用上明确互补——忘掉不安全应用,但保留正确有用的用法。这把「选择性遗忘」从「删事实」升级成「删用法」,难度和真实需求都对上了。
泼三盆冷水(也是论文自己揭的短):当前方法情境分离极弱,在 complementary 设置下现有 unlearning 技术表现稀烂,遗忘-效用权衡强烈;指标跟不上,ROUGE 这类表层指标和「概念级」是否真移除对不上,现有评测本身有盲区;只评了概念层面,真实部署里「忘了 A 但 B 还泄漏 A 的变体」这类纠缠 benchmark 还没覆盖全。
收尾钉一句:ConceptGuard 给「机器遗忘」立了根更对的靶子——我们要删的不是知识点,是知识点的坏用法;可惜今天的工具连这根靶子都打不中,这才是最该被记住的结论。