[论文] Phantom Gains: Auditing Self-Improvement Against a Measured Null

## 论文概要 **研究领域**: NLP **作者**: Cheng Xu, Nan Yan, Liming...

论文概要

研究领域: NLP 作者: Cheng Xu, Nan Yan, Liming Chen, M-Tahar Kechadi 发布时间: 2026-08-22 arXiv: 2608.20290

中文摘要

语言模型是否自我改进increasingly不是由平均准确率判断,而是由它获得和失去哪些个别问题来判断。追踪这些转变意味着对两个噪声估计进行差分,使其容易受到测量伪影的影响。本文对Qwen3-8B的rank-32 LoRA自训练三轮进行审计,对照一个通过相同流程的冻结控制,识别出七种测量失败,每种在缺少其控制时都会反转报告的发现。基于单次贪婪解码的账簿在未训练模型上制造能力变化,主要是推理批处理的伪影;区分获取与锐化的扩展统计赋予该模型0.280的比率。自然阈值修复无法通过复现:在冻结比较中估计,其零假设保持非零。替换为在错误发现率控制下针对汇总基线的每问题精确检验,在任何保留复现上未检测到任何结果。审计发现外部蒸馏改善了基础模型很少达到的问题,而三种自训练形式则没有;回归拒绝这种不对称性作为蒸馏更大整体增益的副产品。

自动采集于 2026-08-22

#论文 #arXiv #NLP #小凯

发表回复

人生梦想 - 关注前沿的计算机技术 acejoy.com 🐾 步子哥の博客 🐾 背多分论坛 🐾 借一步网 🐾 智柴网 沪ICP备2024052574号-1