100倍训练速度、单 GPU 百万种群、纯 int8 无激活函数:EGGROLL 把反向传播掀了

**关键数字**: - 训练速度比 naïve ES 快 **100 倍** - 单 GPU 并行种群 **1...

关键数字: – 训练速度比 naïve ES 快 100 倍 – 单 GPU 并行种群 1,048,576(2^20,超 104 万) – 达到纯 batch 推理吞吐量的 91% – 量化交易任务 PnL +155% – 在 GSM8K / Countdown 上击败 GRPO

注意”100倍”的基准是 naïve 演化策略,不是反向传播。别被数字冲昏头——但即使打对折也很夸张。

论文信息

– 标题:Evolution Strategies at the Hyperscale – arXiv:https://arxiv.org/abs/2511.16652 – 项目页:https://eshyperscale.github.io – 作者:B Sarkar 等,牛津大学 + NVIDIA 联合 – 发表:2025 年 11 月

EGGROLL 在做什么

演化策略(Evolution Strategies, ES)是黑盒优化——不需要梯度,只看 reward。原理通俗讲: 1. 给模型参数加扰动 → 产生一堆”变种” 2. 每个变种跑一遍任务,拿到 reward 3. 按 reward 加权平均,更新参数

问题在于”一堆变种”很贵:百万种群 × 亿级参数 = 显存爆炸。GPU 也不擅长这种大量小扰动的并行模式。

EGGROLL 的核心创新是低秩扰动——借鉴 LoRA 思想,把扰动压到低秩子空间,让百万级种群能在单 GPU 上高效并行。最终吞吐量达到纯推理的 91%——几乎”训练即推理”。

三件最反直觉的事

1. 全 int8、无激活函数的语言模型(EGG)

这是最炸的一个。EGGROLL 从零训出了一个全 int8 权重、没有任何常规激活函数的语言模型——非线性只靠整数饱和加法截断来提供。

这在反向传播时代是根本无法想象的。梯度需要对激活函数求导,没有激活函数就没有梯度,没有梯度就没有 backprop。演化策略不需要求导,所以可以跳出”必须有可微激活函数”这个束缚。

2. 单 GPU 硬刚百万种群

传统 ES 的瓶颈是显存:N 个种群 × 模型参数量。EGGROLL 通过低秩扰动把每个种群的”额外开销”压到几乎可以忽略,单 GPU 跑 104 万种群还能保持 91% 吞吐。这意味着 ES 从”必须集群才能玩”变成”单卡就能跑”——硬件门槛降了一个量级。

3. 在数学推理上击败 GRPO

GSM8K 上 ES 在只用 10% 训练数据时就达到 89.0% 准确率,GRPO 是 85.5%——3.5 个点优势。这跟整个 RL for LLM 的主流方向(GRPO/PPO/DPO)是反着来的。

我的几个观察

1. ES 在 LLM 时代的第二次复活

OpenAI 2017 年那篇”Evolution Strategies as a Scalable Alternative to Reinforcement Learning”曾经火过一阵,后来被反向传播+RL 压下去。原因很简单:当时的 ES 在大模型上效率太差,GPU 不擅长这种并行模式。

EGGROLL 把这个问题从根上解了——低秩扰动让 GPU 重新高效。这是 ES 在 LLM 时代的第二次复活,而且这次手里有真家伙:百万种群、91% 吞吐、int8 模型。如果 OpenAI 2017 那篇是”理论可行”,EGGROLL 就是”工程落地”。

2. “不可微 = 不能训”的边界被推后了一大截

过去几年我们默认接受一个前提:不可微的组件无法端到端训练。所以才有各种松弛技巧(Gumbel-Softmax、straight-through estimator)、各种可微替代(可微渲染、可微排序)。

EGGROLL 给了另一条路:不可微就不微了,直接黑盒搜。int8 + 无激活函数只是开胃菜——更激进的想象空间是:硬量化模型、离散架构、符号执行器,这些原本”训不动”的东西,现在 ES 可以直接搜。

3. 跟之前话题的串联

– Frank Coyle 神经符号 AI(178585127):神经负责”快和模糊”,符号负责”对和确定”——但符号部分怎么训?传统答案是”不可微,靠人写规则” – Gipp reducer(178633570):中间层用纯代码约束 LLM 输出——这是推理时的约束 – EGGROLL:训练时也能跳出可微约束——符号/离散/不可微的组件,现在可以端到端”搜”出来

三件事连起来:神经符号系统的”训练侧空白”被 EGGROLL 这种黑盒优化补上了。 Frank Coyle 说的 Pydantic-to-Ontology 空白,可能不需要新算法,需要的是新优化器。

4. 一个值得警惕的点

论文展示的 PnL +155% 在量化交易场景——这种 reward 信号噪声极大、过拟合风险极高的领域,ES 的”搜”反而可能比”学”更危险。演化策略在噪声 reward 上容易”搜到运气好的参数组合”而不是真正有泛化能力的策略。

看数据的时候别只看 PnL 涨幅——这种任务上必须看 out-of-sample,看夏普比率,看回撤。这是工程实战里最容易踩的坑。

开放问题: ES 训出来的 int8 无激活函数模型,跟 backprop 训出来的 int8 量化模型,推理延迟/功耗到底差多少?有没有人在真实硬件(不只是 GPU,还有 NPU/ASIC)上 benchmark 过?另外,EGGROLL 这种低秩扰动 + 黑盒优化的模式,跟 LoRA 微调的兼容性如何——能不能在已经 backprop 训好的模型上”ES 微调”几个低秩矩阵?这两个问题我有预感会成下一篇热门方向。

发表回复

人生梦想 - 关注前沿的计算机技术 acejoy.com 🐾 步子哥の博客 🐾 背多分论坛 🐾 借一步网 🐾 智柴网 沪ICP备2024052574号-1