论文: Knowledge Acquisition During Pre-training? Large Language Models Learn Better With Auxiliary Views 作者: Joseph Lee, Yidi Huang, Dokyoon Kim arXiv: 2609.04168
—
🎒 开场:两个学生的学习策略
想象两个学生准备期末考试。
学生A把课本读了十遍,每一遍都一字不差。他认为:只要重复够多,知识就会刻在脑子里。
学生B采取了不同策略:读完一遍后,她找来了辅导书、网课视频、同学的笔记、甚至是相关纪录片。同一个概念,她从五个不同角度去理解。
谁的考试成绩会更好?
传统直觉说:A的重复可能带来更好的记忆。但最新的研究发现:B的策略——用”辅助视角”(auxiliary views)学习——在大型语言模型的预训练中表现出惊人的优势。
这不仅解释了为什么数据多样性比单纯的数据量更重要,还揭示了知识获取的一个深层原理。
—
🧠 第一章:LLM到底怎么”学习”知识?
在深入实验之前,咱们得先理解一个问题:当你训练一个GPT或Llama模型时,它到底在学什么?
表面上看,预训练的任务很简单:预测下一个词。给定”猫坐在___”,模型要学会填”垫子”而不是”冰箱”。
但在这个简单的任务背后,模型实际上在建构一个庞大的知识网络: – “猫”是一种动物 – 猫喜欢坐在温暖的地方 – 垫子通常是温暖的 – 冰箱是冷的,不适合坐
> 小贴士:这就像一个小孩通过听大人说话来学习世界。她不需要 explicitly 被告知”猫喜欢温暖”,但通过无数次听到”猫蜷缩在壁炉旁”、”猫喜欢晒太阳”,她自然地归纳出了这个规律。
研究人员一直知道重复很重要。如果一个事实在训练数据中出现1000次,模型记住它的概率远高于只出现1次的事实。这就是为什么互联网上的”常识”(如”巴黎是法国首都”)被LLM掌握得很好,而冷僻知识(如”18世纪尼泊尔某座寺庙的建筑师”)则常常出错。
但这篇论文问了一个更精细的问题:如果重复是必要的,那重复什么? 是同一个句子的机械重复,还是同一个知识的不同表达?
—
🔬 第二章:控制实验——隔离”辅助视角”的效果
研究者设计了一系列精妙的控制实验。他们使用了一个”教师-学生”框架:
1. 选择一个教师模型(较强的LLM),用它生成关于某个知识的不同”视角” 2. 用这些视角去训练学生模型(较小的LLM) 3. 测试学生模型对这个知识的掌握程度
什么是”辅助视角”?举个例子:
原始知识:水在100°C时沸腾。
视角1(解释型):水沸腾是因为分子获得足够动能逃离液体表面。100°C时,这种动能达到阈值。
视角2(对比型):与高海拔地区水在更低温度沸腾对比,说明沸点与气压相关。
视角3(应用型):因此,烹饪时在高压锅(提高气压)中可以让水在更高温度沸腾,食物熟得更快。
视角4(历史型):18世纪之前,人们不知道沸点与气压的关系,这导致了早期海拔测量方法的误差。
同一个事实,四种不同表达。研究者想知道:用这四种视角训练,是否比把原始句子重复四遍效果更好?
—
📈 第三章:五个反直觉的发现
实验结果揭示了五个令人惊讶的发现:
🔍 发现1:重复是必要的,但盲目重复效率低
研究者确认:无论视角多么丰富,如果一个知识只出现一次,模型掌握它的概率很低。重复是必要的。
但关键是:同等”token预算”下(即总共能看多少文字),把部分重复预算分配给辅助视角,比全部用于重复原文效果更好。
这就像学生B的情况:与其把课本读十遍,不如读三遍,再看两篇相关论文、一个科普视频。
🔍 发现2:改述(paraphrase)只在特定条件下有效
研究者测试了”简单改述”——用同义词替换、调整句式结构。结果发现:
– 在小批量(small batch size)训练时,改述有帮助 – 在大批量训练时,改述几乎没有额外收益
> 小贴士:批量大小(batch size)指每次参数更新时同时处理多少样本。小批量意味着更频繁的更新,每次更新基于更少的样本;大批量则相反。
这暗示改述的作用机制可能与”梯度更新的噪声”有关——小批量本身引入的噪声较大,改述提供的多样性可以稳定学习;大批量本身已经平滑了噪声,改述的边际收益就下降了。
🔍 发现3:辅助视角的效果不依赖于教师模型的强度
这是一个关键发现。
研究者想知道:如果辅助视角是由一个”较弱”的教师模型生成的,效果会不会打折扣?结果出乎意料:辅助视角的有效性几乎与生成它的教师模型能力无关。
换句话说,哪怕是一个不完美的老师,只要它能提供不同的角度,就能帮助学生。
这有点像:一个中等水平的助教,如果他能把同一个概念用三种方式讲解,其教学效果可能超过一个顶尖教授的单角度讲解。
🔍 发现4:两种知识形式——情境性与基础性
研究者区分了两种知识:
– 情境性知识(contextual):依赖特定上下文的细节。例如,”在《哈利·波特》中,赫敏用时间转换器上了更多课。” – 基础性知识(foundational):构成理解框架的核心概念。例如,”时间是线性流动的”或”能量守恒定律”。
实验发现:当模型在已有知识基础上学习辅助视角时,效果最佳。如果模型对某个领域完全陌生,辅助视角的帮助有限;但如果模型已经有了基本框架,不同的视角能极大地巩固和扩展这个框架。
这解释了为什么预训练后期的”微调”(fine-tuning)往往比从头训练更高效——基础模型已经构建了知识骨架,只需要用多样化的视角去填充细节。
🔍 发现5:辅助视角通过”层间偏置”和”压缩”起作用
研究者深入到模型的内部机制,发现辅助视角的影响体现在两个层面:
1. 层间偏置(layer-wise biases):不同层对不同类型的信息敏感。辅助视角似乎在”校准”这些层的偏置,使模型对知识的表征更稳定。
2. 压缩(compression):信息论中,压缩意味着去除冗余、保留本质。辅助视角训练后的模型,在表示知识时似乎更高效——用更少的参数编码同样的信息。
这有点像:如果你从五个角度理解”引力”,你不仅记得更牢,而且能在不同场景下灵活运用。你的”心理表征”变得更紧凑、更鲁棒。
—
🧮 第四章:为什么多样性能带来涌现能力?
这篇论文的一个重要贡献,是为”为什么预训练数据多样性如此重要”提供了一个因果解释。
此前,研究者观察到: – 多样化的数据 → 更好的泛化能力 – 单一来源的数据 → 过拟合和记忆
但为什么是因果关系?这篇论文提出:辅助视角是机制。
当模型在预训练中看到同一个知识的不同表达时,它被迫提取”不变量”——即所有视角共享的核心结构。这个过程本质上是在学习抽象表征。
> 小贴士:想象你要教一个外星人理解”爱”。你给它看浪漫电影、读诗歌、观察母子互动、听失恋歌曲。如果外星人足够聪明,它会逐渐剥离具体场景,抓住”强烈的情感连接”这个核心。多样化的视角迫使它做这种抽象。
这还解释了一个长期困惑:为什么扩大模型规模有时会突然带来”涌现能力”(emergent abilities)?也许不是因为模型”变大了”本身,而是因为大模型有容量同时编码更多视角的统计规律,从而提取更深层的抽象。
—
🌐 第五章:对AI训练实践的启示
这些发现对LLM训练有直接的实际意义:
1. 数据策展(Data Curation)> 数据量
与其收集10T的重复网页文本,不如精心选择1T的多样化内容。论文暗示,数据的质量和多样性可能比单纯的规模更重要。
2. 合成数据的潜力
如果辅助视角的效果不依赖于”超强教师”,那么用中等质量的模型生成多视角训练数据,可能是提升小模型性能的有效路径。
3. 课程学习(Curriculum Learning)的新思路
先让模型学习基础概念(建立框架),再引入多样化的辅助视角(巩固扩展)。这与人类教育的”先基础后拓展”逻辑一致。
4. 多语言训练的优势
多语言数据天然提供了”辅助视角”——同一个事实在中文、英文、法文中的表达不同。这也许部分解释了为什么多语言模型往往表现出更强的泛化能力。
—
🎓 结语:从统计鹦鹉到真正的理解
回到开头的学生比喻。
学生A(重复十遍课本)就像传统的”大数据+大模型”路线——堆量,希望统计规律自动涌现。这条路有效,但可能效率低下。
学生B(多种视角)代表了新的洞见:智能不仅仅是记忆,更是从不同角度抽象出共同结构的能力。
这篇论文没有说”重复不重要”。相反,它确认了重复是必要的。但它的核心贡献在于指出:重复什么,比重复多少次更重要。
当我们训练下一个万亿参数的模型时,也许该问的问题不是”我们有多少数据”,而是”我们的数据提供了多少种看世界的方式”。
正如费曼所说:
> “如果你不能用简单的语言解释一件事,你就还没有真正理解它。”
辅助视角的本质,正是迫使模型用”自己的语言”重新表达知识——而这是通往真正理解的必经之路。
—
📚 参考文献
1. Lee, J., Huang, Y., & Kim, D. (2026). Knowledge Acquisition During Pre-training? Large Language Models Learn Better With Auxiliary Views. arXiv:2609.04168.
2. Chang, H., et al. (2024). How Do Large Language Models Acquire Factual Knowledge During Pretraining? arXiv:2406.11813.
3. Hoffmann, J., et al. (2022). Training Compute-Optimal Large Language Models. arXiv:2203.15556.
4. Cheng, D., et al. (2024). Instruction pre-training: Language models are supervised multitask learners. EMNLP 2024.
5. Radford, A., et al. (2018). Improving Language Understanding by Generative Pre-Training. OpenAI Technical Report.
—
解读完成于 2026-09-06 #论文 #arXiv #预训练 #知识获取 #辅助视角 #小凯
