> “如果你想知道一个孩子是怎么学会思考的,你不能给他整个互联网——你得给他一间教室,然后看着他在里面长大。”
—
🎒 引子:一个不可能的实验
想象你是一位发展心理学家。
你想研究一个核心问题:人类的知识,到底是”学来的”还是”本来就在的”?
你不能拿真孩子做实验——因为没有任何一个真实的孩子,是只在”小学五年级以下”的教材里泡大的。他们看动画片、听大人聊天、在超市里看到打折标签、在公交车上听到”前方到站”。你永远无法控制他们的”输入”。
但如果那个”孩子”是一个语言模型呢?
如果你可以精确地控制它从出生那一刻起,只见过小学 K-5 阶段的教材内容——不包含初中数学、不包含高中物理、不包含维基百科上关于量子力学的词条、不包含 Reddit 上的阴谋论——然后你就可以问:
– 它学会了什么? – 它没学会什么? – 你用各种方法”补课”,能补出它从没见过的知识吗?
这正是 LittleLearner 的核心构想。
—
📐 LittleCurriculum:88B token 的”小学宇宙”
来自马普所智能系统研究所(MPI-IS)和 ETH 苏黎世的团队做了一件前所未有的事:他们从 FineWeb-Edu 这个大规模教育语料库中,筛出了一个 88B token 的子集,只保留美国 K-5(幼儿园到五年级)阶段的教学内容。
筛选管线极其精密,分五层:
1. 年龄习得预过滤:用 Age-of-Acquisition(AoA)词表,剔除五年级以上才学的词汇 2. LLM-J 分类器:训练一个判断模型,逐条判断文本是否属于小学内容 3. 课程对齐分类:对接 CommonCore 课程标准,给每条文本打年级标签 4. 符号过滤:用规则干掉残留的中学概念(比如”二次方程””细胞分裂”) 5. 频率采样:调整词频分布,避免某些词过度代表
最终得到一个 88B token 的语料库——听起来很大,但和 Llama 3 的 15T token 相比,只是 0.6%。
关键不是大小,是边界清晰。你确切知道这个模型”见过什么、没见过什么”。
—
🧠 LittleLearner:在小学教室里训练的 5B 模型
在这个语料库上,团队从零训练了一个 5B 参数的语言模型,用 Qwen3 架构,在 8 块 NVIDIA B200 GPU 上跑了 100 小时。
这个模型叫 LittleLearner。
它有足够的语言能力做开放式评估——能说连贯的话、能回答简单问题、能做基础推理。但它的知识边界是可追踪的:你问它二次方程,它不会;你问它细胞分裂,它不会;你问它法国大革命,它不会——因为这些内容在它的”小学宇宙”里根本不存在。
这就像一个在封闭社区长大的孩子:他语言能力正常,但你问他外面的世界,他只能用小学课本里的概念去猜。
—
🔬 四个实验:能不能”补课”?
有了这个沙盒,团队做了一组关键实验:能不能通过后训练或上下文学习,让 LittleLearner 掌握超出 K-5 范围的能力?
实验 1:模型变大能救吗?
不能。把参数量从 1B 扩到 5B,在 K-5 范围内的任务上稳步提升,但超出 K-5 的任务(比如初中数学)几乎没有任何改善。参数量放大不会凭空产生知识。
实验 2:GRPO 后训练能救吗?
团队用 GRPO(Group Relative Policy Optimization)对 LittleLearner 做强化学习后训练,专门针对超出 K-5 范围的数学题。
结果:模型在已学过的知识上利用得更好了,但真正的”范围外”能力没有提升。
这就像一个只会加减乘除的孩子,你用奖励信号逼他做微积分题——他会更努力地用加减乘除去凑答案,但不会真的发明导数。
实验 3:上下文学习能救吗?
给 LittleLearner 喂几道初中数学题的示例,看它能不能”举一反三”。
结果一样:在见过的知识范围内有提升,范围外没有。
实验 4:什么决定了能力天花板?
团队发现,LittleLearner 的能力边界和 K-5 课程标准的对应关系非常清晰——它能做五年级及以下的数学题,不能做六年级及以上的。这不是模糊的”能力不足”,而是精确的”知识缺失”。
—
💡 这意味着什么?
1. “数据决定论”获得最强证据
过去几年,”scaling law”叙事主导了 AI 领域:参数量越大、数据越多,模型就越强。但 LittleLearner 提供了一个反实验:当你精确控制数据范围时,5B 参数的模型也会被锁死在那个范围里。
参数量救不了范式错位。这和 Euclid-MCP 的发现异曲同工:480B 大模型在规则推理上和 8B 一样烂,因为问题不在参数量,在训练数据。
2. “涌现”可能只是”数据泄漏”
很多人观察到 LLM 在某个参数规模”突然涌现”某种能力。但 LittleLearner 提出了一个尴尬的可能:那些”涌现”,也许只是训练数据里早就有的东西,在参数量足够大时被”想起来”了。
如果你不知道模型见过什么,你就无法区分”学会”和”想起”。
3. 后训练的”天花板效应”
GRPO 和 ICL 都不能突破知识边界——这个发现对 RL 训练社区尤其重要。它意味着:后训练只能重新组合已有知识,不能凭空创造新知识。
这和 EvoThink 的”从错到对”训练结果一致:RL 能让模型更好地利用已有能力,但不能让它获得从未见过的能力。
—
🌊 更深一层:为什么”有界沙盒”是科学的基础
LittleLearner 的真正贡献,不是那个 5B 模型本身,而是它提供了一个可控实验场。
物理学有粒子加速器:你精确控制输入能量,看会发生什么。生物学有模式生物:线虫、果蝇、斑马鱼——你精确控制基因和环境,看发育会怎样。
但 AI 研究长期没有这个。你拿 Llama 3 做实验,你不知道它见过什么、没见过什么。你观察到任何行为,都无法确定它是”学来的”还是”训练数据里本来就有”。
LittleLearner 改变了这一点。它是一个已知知识边界的 AI——你知道它没见过二次方程,所以当你测试它对二次方程的反应时,你观察到的任何能力都是”泛化”或”迁移”,而不是”回忆”。
这才是真正的科学:控制变量,才能得出因果。
—
🎭 类比:心理学史上的”限制输入”实验
LittleLearner 让人想起心理学史上两个著名的”限制输入”实验:
– Genie 案例(1970):一个被囚禁到 13 岁的女孩,在语言习得关键期没有接触过语言。她后来被解救后,学会了词汇但始终无法掌握语法。这个悲剧案例揭示了”关键期”的存在。
– Kaspar Hauser(19 世纪德国):一个被关在暗室里长大的少年,解救后对感官刺激异常敏感。他的案例揭示了早期环境对认知发育的塑造。
LittleLearner 是这两个案例的”AI 版”——一个在受控环境里长大的 AI,用来研究”环境如何塑造能力”。
但和人类案例不同,LittleLearner 可以被复制、可以重新训练、可以做各种侵入式实验。它是一个可以反复做的”限制输入”实验。
—
🚧 局限和未来
团队坦诚承认:5B 规模可能不足以观察到某些涌现行为(比如 ICL 在更大规模上可能更强)。但他们指出,这个框架可以自然扩展到其他”教学启发式约束”和更大模型规模。
论文末尾列出了几个探索方向: – RL 与发现:能否用强化学习驱动模型”发现”超出 K-5 的数学定理? – 持续学习:LittleLearner 能否在保持旧知识的同时学习新知识? – 教育科学:能否用 LittleLearner 模拟人类学习路径? – 人机对比:LittleLearner 的学习曲线和人类儿童有何异同?
—
🎬 收尾:一个”有界 AI”的时代
过去三年,AI 领域的主旋律是”更大、更多、更强”。但 LittleLearner 提供了一个反方向:更小、更受控、更可解释。
它不是要和 GPT-5 竞争。它是要成为一个研究工具——就像线虫之于神经科学,果蝇之于遗传学,氢原子之于量子力学。
当你想研究”学习是什么”,你需要一个已知边界的 learner。
LittleLearner 就是那个边界清晰的 learner。
—
论文链接:arXiv:2608.13545
项目页面:见论文原文(项目页链接在论文中提供)
语料和模型:LittleCurriculum(88B token)和 LittleLearner(5B 参数)已开源,供学术社区研究使用
—
“我们不能在互联网上养大一个模型,然后假装理解它是怎么学会的。要理解学习,先得有一个教室。LittleLearner 就是那个教室。”
