Mixture of Training:把大模型训练拆成小零件再拼回去,Google找到了预训练的新玩法

想象你要盖一栋12层的大楼。传统做法是从地基开始,一层一层往上建,每一层都依赖下面的楼层结构。如果第7层出了问...

想象你要盖一栋12层的大楼。传统做法是从地基开始,一层一层往上建,每一层都依赖下面的楼层结构。如果第7层出了问题,你可能需要从头来过。

但如果换一种方式:先把大楼拆成几个独立的模块——比如1-6层和7-12层——每个模块在脚手架里独立施工,最后再拼装在一起,会怎样?

这听起来像是建筑学的异端,但Google的研究团队把它用在了语言模型预训练上。结果出人意料:拆开训练再拼回去的模型,能达到和整体训练相同的性能

预训练的规模化瓶颈

大语言模型的训练通常被组织为一个端到端的整体优化过程。所有层同时训练,所有参数同步更新。这种”整体式”训练带来三个问题:

1. 规模化瓶颈:所有层必须一起训练,任何改进都需要重启或继续这个庞大的耦合系统。 2. 故障传播:训练中途任何一层出问题,整个训练运行受影响。 3. 迭代成本高:每次改进都需要重新跑完整的大规模训练。

论文提出了一个直击核心的问题:预训练能否被分解为更小的、可独立训练的子任务,然后再重组为一个连贯的更大模型?

这个问题在MOSS(Methods and Opportunities at Small Scale)workshop的语境下尤其自然——如果小规模训练运行可以作为可复用的科学单元,训练研究将变得更便宜、更可复现、更容易迭代。

Mixture of Training的三阶段流程

Mixture of Training(MoT)的核心设计是脚手架式模块化预训练。它把目标Transformer分成K个连续的层块,每个块在一个冻结的预训练aligner(对齐器)脚手架内独立训练,最后重组。

Stage 0:准备aligner

首先训练或选择一个aligner——一个与目标模型结构兼容的小型预训练模型。aligner被切成和目标模型相同数量的块,每块与目标模型的对应块形状兼容。

关键约束:aligner必须与目标模型形状兼容——相同的宽度、注意力头维度、前馈层宽度、token嵌入空间和输出头。这样aligner的切片和目标切片可以直接互换,不需要投影层或缝合层。

Stage 1:并行训练各块

对每个目标块 f_i,构建一个脚手架网络 S_i

    \[S_i = a_K circ cdots circ a_{i+1} circ f_i circ a_{i-1} circ cdots circ a_1\]

其中 a_j 是aligner的第j层(冻结),只有 f_i 是可训练的。每个脚手架用标准的下一token预测损失优化。

这意味着:每个目标块在aligner提供的表示上下文中学习,但块与块之间不交换梯度。它们是独立但非孤立的——共享同一个表示接口。

Stage 2:重组

丢弃aligner,把训练好的目标块 f_1, f_2, ldots, f_K 拼装成完整模型 hat{F} = f_K circ cdots circ f_1。可选地进行一个短的端到端适应训练。

重组后、适应前的模型被称为cold-composed(冷组合)模型。它的质量直接衡量了脚手架训练对独立训练块的对齐程度。

实验结果

论文在一个12层、13亿参数的Gemma风格模型上进行实验,使用C4数据集的英文部分。

主实验

模型/方案PPL ↓训练EF全充电EFToken(B)关键路径估计
整体基线15.0268.4268.433.61.0×
MoT冷组合19.3128.2157.926.24.2×
MoT + 15k适应15.9159.7189.430.12.8×
MoT质量对齐15.0255.3285.047.11.7×

几个关键发现:

冷组合就能用:即使不做任何端到端适应,两个独立训练的6层子模型拼在一起,perplexity也只有19.3。这说明aligner提供的表示接口确实让独立训练的块保持了兼容性。

15k步适应就够:仅用15k步端到端适应训练,perplexity从19.3降到15.9,接近基线的15.0。这表明冷组合的”不兼容”是轻微的,不需要大量训练就能修复。

质量对齐方案:把子模型训练延长到75k步,加上30k步适应训练,能达到和基线完全相同的perplexity 15.0。但代价是处理更多token(47.1B vs 33.6B)。

Aligner的复用优势

关键的经济账在aligner的复用。aligner本身需要29.7 EFLOPs的训练成本。如果只用于一次训练,质量对齐方案的总成本是285.0 EFLOPs,比基线的268.4还高。

但如果同一个aligner被R次独立训练运行复用,每次的有效成本是:

    \[255.3 + frac{29.7}{R}\]

R geq 3 时,有效成本低于基线。当 R = 10 时,有效成本降至258.3 EFLOPs。

这意味着:aligner是一种基础设施投资。第一次使用不划算,但从第三次开始就比整体训练更经济。

消融实验

论文还提供了几个关键消融:

Aligner是必需的:没有aligner的脚手架训练,冷组合质量大幅下降。aligner提供的表示接口是独立训练块能兼容的关键。

不相交数据流改善冷组合:两个子模型用不同的数据子集训练,冷组合质量更好。这可能是因为数据多样性减少了块间的表示冲突。

分割数与质量的权衡:增加分割数K(从2到4到更多)能进一步缩短关键路径,但质量会下降。K=2是当前实验设置下的甜蜜点。

这意味着什么

MoT最直接的价值不在于”更快”或”更省”——在单次训练场景下,它甚至更贵。它的真正价值在于改变了预训练的组织方式

训练研究可复现:研究者可以在小块上快速迭代实验,而不需要每次跑完整的大规模训练。

故障隔离:一个块的训练失败不影响其他块,只需要重训失败的块。

模块化创新:可以尝试不同的块训练策略(不同数据、不同超参数),然后组合最佳结果。

渐进式扩展:可以先训练一个6层模型,再训练另一个6层块,组合成12层模型。这比从头训练12层更灵活。

从概念谱系看,MoT是”分工比统一更有效”原则的又一个实例。传统预训练把所有层绑在一起优化——这是”统一”。MoT把训练拆成块的组合——这是”分工”。和Euclid-MCP的”让LLM当诗人,让Prolog当会计”一样,都是承认不同部分有不同的最优策略,不应该用同一个优化过程处理。

局限与诚实评价

论文非常诚实地承认了局限:

1. 小规模验证:实验只在13亿参数模型上做,更大规模的行为未知。论文明确说”我们不把MoT作为整体预训练的通用替代品”。 2. 质量对齐不省钱:在单次训练场景下,质量对齐方案甚至比基线更贵。优势只在aligner复用时才体现。 3. 冷组合有gap:冷组合perplexity 19.3 vs 基线15.0,gap不小。15k步适应能缩小到15.9,但仍非完全对齐。 4. aligner选择:论文没有深入讨论aligner选择对结果的影响。不同aligner可能带来不同的表示接口质量。

这不是一个”颠覆传统训练”的论文,而是一个”打开新可能”的论文。它证明了一个概念:预训练可以被分解和重组。这个概念本身就有价值——它为训练研究提供了新的实验单元和复用策略。

论文链接:https://arxiv.org/abs/2608.13277

HTML版本:https://arxiv.org/html/2608.13277v1

发表于:COLM 2026 MOSS Workshop

发表回复

人生梦想 - 关注前沿的计算机技术 acejoy.com 🐾 步子哥の博客 🐾 背多分论坛 🐾 借一步网 🐾 智柴网 沪ICP备2024052574号-1