想象你要盖一栋12层的大楼。传统做法是从地基开始,一层一层往上建,每一层都依赖下面的楼层结构。如果第7层出了问题,你可能需要从头来过。
但如果换一种方式:先把大楼拆成几个独立的模块——比如1-6层和7-12层——每个模块在脚手架里独立施工,最后再拼装在一起,会怎样?
这听起来像是建筑学的异端,但Google的研究团队把它用在了语言模型预训练上。结果出人意料:拆开训练再拼回去的模型,能达到和整体训练相同的性能。
预训练的规模化瓶颈
大语言模型的训练通常被组织为一个端到端的整体优化过程。所有层同时训练,所有参数同步更新。这种”整体式”训练带来三个问题:
1. 规模化瓶颈:所有层必须一起训练,任何改进都需要重启或继续这个庞大的耦合系统。 2. 故障传播:训练中途任何一层出问题,整个训练运行受影响。 3. 迭代成本高:每次改进都需要重新跑完整的大规模训练。
论文提出了一个直击核心的问题:预训练能否被分解为更小的、可独立训练的子任务,然后再重组为一个连贯的更大模型?
这个问题在MOSS(Methods and Opportunities at Small Scale)workshop的语境下尤其自然——如果小规模训练运行可以作为可复用的科学单元,训练研究将变得更便宜、更可复现、更容易迭代。
Mixture of Training的三阶段流程
Mixture of Training(MoT)的核心设计是脚手架式模块化预训练。它把目标Transformer分成K个连续的层块,每个块在一个冻结的预训练aligner(对齐器)脚手架内独立训练,最后重组。
Stage 0:准备aligner
首先训练或选择一个aligner——一个与目标模型结构兼容的小型预训练模型。aligner被切成和目标模型相同数量的块,每块与目标模型的对应块形状兼容。
关键约束:aligner必须与目标模型形状兼容——相同的宽度、注意力头维度、前馈层宽度、token嵌入空间和输出头。这样aligner的切片和目标切片可以直接互换,不需要投影层或缝合层。
Stage 1:并行训练各块
对每个目标块 ,构建一个脚手架网络
:
其中 是aligner的第j层(冻结),只有
是可训练的。每个脚手架用标准的下一token预测损失优化。
这意味着:每个目标块在aligner提供的表示上下文中学习,但块与块之间不交换梯度。它们是独立但非孤立的——共享同一个表示接口。
Stage 2:重组
丢弃aligner,把训练好的目标块 拼装成完整模型
。可选地进行一个短的端到端适应训练。
重组后、适应前的模型被称为cold-composed(冷组合)模型。它的质量直接衡量了脚手架训练对独立训练块的对齐程度。
实验结果
论文在一个12层、13亿参数的Gemma风格模型上进行实验,使用C4数据集的英文部分。
主实验
| 模型/方案 | PPL ↓ | 训练EF | 全充电EF | Token(B) | 关键路径估计 |
|---|---|---|---|---|---|
| 整体基线 | 15.0 | 268.4 | 268.4 | 33.6 | 1.0× |
| MoT冷组合 | 19.3 | 128.2 | 157.9 | 26.2 | 4.2× |
| MoT + 15k适应 | 15.9 | 159.7 | 189.4 | 30.1 | 2.8× |
| MoT质量对齐 | 15.0 | 255.3 | 285.0 | 47.1 | 1.7× |
几个关键发现:
冷组合就能用:即使不做任何端到端适应,两个独立训练的6层子模型拼在一起,perplexity也只有19.3。这说明aligner提供的表示接口确实让独立训练的块保持了兼容性。
15k步适应就够:仅用15k步端到端适应训练,perplexity从19.3降到15.9,接近基线的15.0。这表明冷组合的”不兼容”是轻微的,不需要大量训练就能修复。
质量对齐方案:把子模型训练延长到75k步,加上30k步适应训练,能达到和基线完全相同的perplexity 15.0。但代价是处理更多token(47.1B vs 33.6B)。
Aligner的复用优势
关键的经济账在aligner的复用。aligner本身需要29.7 EFLOPs的训练成本。如果只用于一次训练,质量对齐方案的总成本是285.0 EFLOPs,比基线的268.4还高。
但如果同一个aligner被R次独立训练运行复用,每次的有效成本是:
当 时,有效成本低于基线。当
时,有效成本降至258.3 EFLOPs。
这意味着:aligner是一种基础设施投资。第一次使用不划算,但从第三次开始就比整体训练更经济。
消融实验
论文还提供了几个关键消融:
Aligner是必需的:没有aligner的脚手架训练,冷组合质量大幅下降。aligner提供的表示接口是独立训练块能兼容的关键。
不相交数据流改善冷组合:两个子模型用不同的数据子集训练,冷组合质量更好。这可能是因为数据多样性减少了块间的表示冲突。
分割数与质量的权衡:增加分割数K(从2到4到更多)能进一步缩短关键路径,但质量会下降。K=2是当前实验设置下的甜蜜点。
这意味着什么
MoT最直接的价值不在于”更快”或”更省”——在单次训练场景下,它甚至更贵。它的真正价值在于改变了预训练的组织方式:
训练研究可复现:研究者可以在小块上快速迭代实验,而不需要每次跑完整的大规模训练。
故障隔离:一个块的训练失败不影响其他块,只需要重训失败的块。
模块化创新:可以尝试不同的块训练策略(不同数据、不同超参数),然后组合最佳结果。
渐进式扩展:可以先训练一个6层模型,再训练另一个6层块,组合成12层模型。这比从头训练12层更灵活。
从概念谱系看,MoT是”分工比统一更有效”原则的又一个实例。传统预训练把所有层绑在一起优化——这是”统一”。MoT把训练拆成块的组合——这是”分工”。和Euclid-MCP的”让LLM当诗人,让Prolog当会计”一样,都是承认不同部分有不同的最优策略,不应该用同一个优化过程处理。
局限与诚实评价
论文非常诚实地承认了局限:
1. 小规模验证:实验只在13亿参数模型上做,更大规模的行为未知。论文明确说”我们不把MoT作为整体预训练的通用替代品”。 2. 质量对齐不省钱:在单次训练场景下,质量对齐方案甚至比基线更贵。优势只在aligner复用时才体现。 3. 冷组合有gap:冷组合perplexity 19.3 vs 基线15.0,gap不小。15k步适应能缩小到15.9,但仍非完全对齐。 4. aligner选择:论文没有深入讨论aligner选择对结果的影响。不同aligner可能带来不同的表示接口质量。
这不是一个”颠覆传统训练”的论文,而是一个”打开新可能”的论文。它证明了一个概念:预训练可以被分解和重组。这个概念本身就有价值——它为训练研究提供了新的实验单元和复用策略。
—
论文链接:https://arxiv.org/abs/2608.13277
HTML版本:https://arxiv.org/html/2608.13277v1
发表于:COLM 2026 MOSS Workshop
