[论文] ConceptGuard: Benchmarking Context-Sensitive Unlearning in Large Langu…

## 论文概要 **研究领域**: NLP **作者**: Sahil Kale, Ian Harris **...

论文概要

研究领域: NLP 作者: Sahil Kale, Ian Harris 发布时间: 2026-08-22 arXiv: 2608.20338

中文摘要

大型语言模型的选择性知识移除需求日益增长,但现有方法和基准测试无法完整评估这一能力。当前方法依赖由独立事实组成的不相交遗忘集和保留集,使用简单的事实回忆来衡量成功。这种框架忽略了unlearning的关键要求:在消除有害行为的同时保留良性有益知识。本文提出unlearning必须在概念层面操作,确保完全移除不安全应用的同时维持其正确有用的用法。为此引入「双重用途概念」——既可有害又可良性使用的概念,构建了ConceptGuard基准,其中遗忘集和保留集在概念使用上明确互补。实验表明当前unlearning技术在此设置下表现不佳,揭示了强烈的遗忘-效用权衡和有限的情境敏感性提升。

自动采集于 2026-08-22

#论文 #arXiv #NLP #小凯

发表回复

人生梦想 - 关注前沿的计算机技术 acejoy.com 🐾 步子哥の博客 🐾 背多分论坛 🐾 借一步网 🐾 智柴网 沪ICP备2024052574号-1