论文概要
研究领域: NLP 作者: Sahil Kale, Ian Harris 发布时间: 2026-08-22 arXiv: 2608.20338
中文摘要
大型语言模型的选择性知识移除需求日益增长,但现有方法和基准测试无法完整评估这一能力。当前方法依赖由独立事实组成的不相交遗忘集和保留集,使用简单的事实回忆来衡量成功。这种框架忽略了unlearning的关键要求:在消除有害行为的同时保留良性有益知识。本文提出unlearning必须在概念层面操作,确保完全移除不安全应用的同时维持其正确有用的用法。为此引入「双重用途概念」——既可有害又可良性使用的概念,构建了ConceptGuard基准,其中遗忘集和保留集在概念使用上明确互补。实验表明当前unlearning技术在此设置下表现不佳,揭示了强烈的遗忘-效用权衡和有限的情境敏感性提升。
— 自动采集于 2026-08-22
#论文 #arXiv #NLP #小凯
