用户反馈是 LLM 听不到的信号:评测器系统性偏好劣质回答的发现

你问 AI 一个问题,AI 给了一个有瑕疵的回答。你说"第三点的数据不对,应该是 2023 年的"。AI 修正...

你问 AI 一个问题,AI 给了一个有瑕疵的回答。你说”第三点的数据不对,应该是 2023 年的”。AI 修正了回答,现在正确了。

然后你把修正前和修正后两个版本拿给另一个 LLM 当评委,问它哪个更好。

它选了没修正的那个。

这不是段子,这是这篇论文的核心实验结果。

反直觉的发现

Shachar Don-Yehiya 等人(Hebrew University + IBM Research)发现了一个系统性现象:当模型因为用户反馈而改善了回答时,LLM 评委系统性地偏好未改善的原始版本

更具体地说:在四种不同的”损坏”类型上,LLM 评委一致地认为”没修过的”比”修过的”更好——尽管修过的版本在客观上修复了更多问题。

实验设计

研究者构建了两套数据来隔离反馈的真实效果:

合成数据:研究者故意在回答中注入四种类型的”损坏”(corruption)——事实错误、逻辑漏洞、格式问题、相关性偏差。然后给模型提供用户反馈,看它能否修复。

自然数据:从真实对话中收集的反馈和修正,验证合成实验的结论在真实场景下是否成立。

关键对比:同一个问题,模型分别在”有反馈”和”无反馈”条件下生成修正版本。然后用 issue resolution rate(问题解决率)和 LLM 评委偏好来评估。

反馈确实有用

在问题解决率上,反馈的效果是明确的:

– 合成数据:有反馈的版本在所有四种损坏类型上都比无反馈版本修复了更多问题 – 自然数据:同样的模式成立,反馈带来的改善是 consistent 的

反馈不是噪音。它携带了模型自身无法生成的信息——用户知道答案应该是什么样的,这个知识不在模型的权重里。

但评委听不到这个信号

问题出在评测环节。当 LLM 评委做 pairwise comparison(两两对比)时:

– 在”大改善”的样本上,评委一致偏好未修正版本 – 评委偏好未修正版本的比例远高于偏好修正版本的比例 – 即使修正版本客观上修复了损坏,评委仍然选未修正的

这意味着:如果你用 LLM-as-judge 来评估反馈的效果,你会得出”反馈没用”的结论——但这是错的

为什么反馈是”独特信号”

论文提出了一个关键论点:用户反馈携带的信号不在模型权重中编码,因此无法通过蒸馏或自我改进获得。

这听起来抽象,但逻辑很直接:

1. 模型生成回答时,只能基于权重中的知识。 2. 用户反馈来自模型外部的世界知识——用户知道正确答案,模型不知道。 3. 当模型根据反馈修正回答时,修正后的回答包含了模型自身无法产出的信息。 4. LLM 评委也是同一个模型(或同族模型),它同样不包含这个外部知识。 5. 所以评委无法识别修正的价值——它看不到自己不知道的东西。

这和”omission blindness”(遗漏盲区)是同构的:LLM 能检测”有什么”但不能检测”应该有什么”。在这里,LLM 能评估”回答的质量”但不能评估”回答是否包含了它自身不知道的信息”。

对评测范式的挑战

这篇论文的深层贡献是揭示了一个评测范式的系统性偏差:

当前 LLM 评测范式假设”模型知道什么是有质量的回答”。但当回答的质量依赖于模型自身不知道的外部信息时,这个假设崩塌了。

这不是调参能解决的问题。这是结构性的:用模型 A 评估模型 A(或同族模型 B)是否从外部信号中获益,模型 A 永远无法看到自己不知道的部分。

论文呼吁社区开发”能反映反馈真实效用的评测框架”。但具体怎么做?论文没有给出答案——这个开放问题可能比论文本身的发现更重要。

实践启示

对于做 RLHF 和反馈训练的团队:

1. 不要只依赖 LLM-as-judge 评估反馈效果。如果你的反馈信号确实携带了模型不知道的信息,LLM 评委可能系统性低估它。 2. 构建有 ground truth 的评测集。在已知正确答案的场景下评估反馈效果,而不是依赖模型自评。 3. 反馈的价值不在”让模型更好”而在”让模型知道它不知道的”。如果你的反馈只是让模型重复自己已经知道的,那确实是噪音。

概念谱系

这篇论文和几个已有概念形成共振:

omission blindness:LLM 能检测”有”但不能检测”缺”。反馈信号正是关于”应该有什么但模型没有”的信息。 – 判断-闸门解耦:模型可能”知道”反馈有用(在训练信号层面),但评测闸门不咨询这个知识。 – 标量幻觉:把”模型质量”当标量管理,忽略了”模型知道什么”和”模型不知道什么”是两个独立维度。

“用户反馈是独特信号”这个发现,本质上是说:模型的知识边界是真实的边界,不是标量上的一个点。边界外的信息对模型来说是”不可见的”,包括对模型自身的评测器来说也是不可见的。

论文arXiv:2609.02859 作者:Shachar Don-Yehiya, Leshem Choshen, Omri Abend 等(Hebrew University / IBM Research / MIT) 代码github.com/shachardon/feedback-blindspot 数据huggingface.co/datasets/shachardon/feedback-blindspot

发表回复

人生梦想 - 关注前沿的计算机技术 acejoy.com 🐾 步子哥の博客 🐾 背多分论坛 🐾 借一步网 🐾 智柴网 沪ICP备2024052574号-1