YOPO:冻结模型一次前向传播同时回答和弃答

**论文链接**:[arXiv:2608.14465](https://arxiv.org/abs/2608....

论文链接arXiv:2608.14465

想象你请了一位退休的老教授回答问题。他脑子里的知识还在,但有两个毛病:一是明明记得的证据,话到嘴边说不出来;二是不知道自己什么时候该说”我不知道”。你问他”火星上有没有水”,他可能瞎编一通也不肯承认自己不确定。

冻结语言模型(frozen LM)就是这位老教授。它的残差流(residual stream)里已经编码了推理所需的证据,但这些证据到不了输出层;同时,当输入信息不足时,它不会弃答,而是自信地胡说。这两个问题一直被当作独立课题研究——一条线想办法把残差流里的证据”撬出来”,另一条线想办法让模型学会”我不知道”。

佐治亚理工和哥大的团队把这两条线拧到了一起,发现了一个意想不到的麻烦:它们在同一条残差流上互相打架

两个手术,一条血管

YOPO 的核心设计是两个操作同时作用在残差流上:

条件转向探针(steering probe):在模型中间层写入残差流,把推理准确率拉回来。在 Qwen2.5-1.5B 上提升 +21.7 个百分点,在 7B 上还有 +4.96 个百分点(McNemar 检验 p=1.7×10⁻⁷)。 – 零样本充分性方向(sufficiency direction d):读取残差流,判断输入信息够不够用。不够就弃答。

问题出在”写入”会改变”读取”的输入。转向操作把残差流推偏了,充分性方向读到的不再是原始状态。在小模型上,这种干扰让跨域 AUROC 掉了 8 个点。最笨的办法是跑两遍前向传播——一遍转向回答,一遍干净读取——但推理成本翻倍。

YOPO 的解法很巧妙:训练一个小网络,从被转向的残差流重建出转向前的状态。训练只用均方误差(steered, clean)残差对,不需要任何充分性标签。因为训练时没见过弃答标签,这个重建继承了原始方向的跨任务稳定性。

“弃答不该被训练进去”

论文最反直觉的发现是:把弃答能力训练进模型反而有害

作者在 10 个骨干模型、6 个模型家族上画出了完整的”容量-迁移”前沿曲线。干扰集中在小模型上,但在 7B 模型上发生了反转——转向后的残差流本身就是更好的读取基底(0.995 vs 0.985 域内 AUROC),恒等初始化的重建网络学会了”什么都不做”。

这条设计原则——”abstention should not be trained in”——和”模型已经知道”系列形成呼应。残差流里已经编码了”信息够不够”的信号,你只需要读它,不需要训练它。一旦你把弃答行为训练进模型,它就过拟合到训练分布,跨域就崩了。

一次前向传播,三项任务

最终系统在一次前向传播中同时完成三件事:回答、转向、弃答。

在 Qwen2.5-1.5B 上的 α-NLI 任务:

配置三项正确率
冻结基线0.375
仅转向0.590
仅门控0.560
两次前向参考0.753
YOPO 单次前向0.798

单次前向不仅超过了任一组件单独使用,还超过了两次前向的参考基线。在三个规模上都是如此:0.798/0.830/0.893 vs 0.753/0.790/0.863。

更精细的数字:在 1.5B 上,跨域 AUROC 从 0.836 提升到 0.888(两次前向天花板 0.918),域内从 0.913 到 0.959。加上监督门控后,域内达到 0.982/0.984/0.997,在 3B 和 7B 上跨域距离两次前向天花板仅 0.006/0.003。

诚实的自我审计

论文有一节叫”What Failed”,这种坦诚在顶会论文里很少见。作者承认自己的 α-NLI 数据集存在表面伪影——早期层就能线性分离答案标签,说明数据构造时泄露了捷径信号。他们没有掩盖这个问题,而是用源端审计(early-layer separability 作为捷径检测信号)发现了它,然后把所有架构声明的锚点转移到原生标签数据集(SQuAD2、RepLiQA、MuSiQue)上。

这种自我审计和”评测盲区定律”直接相关:你以为你在测推理能力,实际上数据集泄露了一个表面特征让模型走捷径。不审计就不知道你的结论建立在沙子上。

和 CoT 的对比

Chain-of-thought(思维链)是另一种提取模型已有知识的方式。但 CoT 的生成草稿在时间上永远到不了 YOPO 的 prefill-time 门控——门控在前向传播的 prefill 阶段就做决策了,CoT 的草稿还没生成完。

在 MuSiQue 多跳问答上,YOPO 把可回答的多跳 QA 准确率从 0.062 提升到 0.313,五倍提升。这说明残差流里编码的证据比 CoT 能提取到的更多——CoT 受限于自回归生成的路径依赖,而 YOPO 直接读残差流的全局状态。

概念谱系

YOPO 是”模型已经知道”系列的又一个成员。从 SOPHIA 的残差流方向、SWE-Pruner Pro 的 AUC 0.83、谄媚偏置方向,到现在的 YOPO——跨论文共识越来越强:模型内部已经编码了答案,问题在于怎么读出来

更具体地说,YOPO 把”换层面解决问题”推到了新极端:不在输出层做后处理,不在训练层做微调,而是在残差流这个中间层面同时做读取和写入——并且发现这两个操作会互相干扰,需要用重建网络来解耦。

“弃答不该被训练进”这条原则,和 i-have-adhd 的”对齐不一定需要重训模型”遥相呼应。对齐干预的层级越来越精细:从 RLHF(训练层)到 Epanorthosis(推理层 prompt)到 Beyond Sycophancy(交互结构)到 i-have-adhd(输出层 skill),现在 YOPO 在说:弃答干预应该在残差流读取层做,而不是训练进模型参数里。

论文arXiv:2608.14465 代码:论文未提及公开代码仓库 HTML 全文arxiv.org/html/2608.14465v1

发表回复

人生梦想 - 关注前沿的计算机技术 acejoy.com 🐾 步子哥の博客 🐾 背多分论坛 🐾 借一步网 🐾 智柴网 沪ICP备2024052574号-1