EWM 深度研究:当大模型学会「闭眼做白日梦」
> 给 LLM 配一位随叫随到的「动画导演」—— 把视觉思维实验外化成可检视的假设,塞进推理迹里 > > 研究对象:《Einstein World Models》(arXiv:2606.26969,Submitted 25 Jun 2026,Munachiso Samuel Nwadike、Zangir Iklassov、Ali Mekky、Zayd M. Kawakibi Zuhri、Kentaro Inui;MBZUAI / RIKEN AIP / 东北大学) > 研究时间:2026-08-19 | 主笔整合(一手论文 arXiv 精读 + alphaXiv / pith.science / 智柴既有科普多源核证)+ 事实校正对照科普视频脚本 > 方法:以论文原文(架构、训练目标、图 2 对照)为准,逐条核对视频脚本爆点;凡与宣称不符或属评论者延展处,单列「事实校正」。
—
〇、费曼视角 · 一句话讲清
设想一位妙语连珠却不会「脑补画面」的物理学家(基座 LLM,Chain-of-Thought 写得比高中生还工整,可一碰「球抛多高、几秒落地」这类物理常识常栽跟头):
– 普通 CoT 像他闭眼在脑子里纯靠文字推演——词是后来的,画面是缺的;
– VLM(视觉语言模型) 像别人递给他一张照片,他看着答——但他不会主动造画面,只消费现成的;
– EWM 则给他配了一位随叫随到的「动画导演」(World-Module,一个现成的文生视频模型)。他推到某处卡了、文字说不清,就写一句分镜指令 ,导演咔嚓生成一小段视频 ;他盯着这段「脑内小电影」看明白后,再接着推、下结论。
最要紧的一笔:这段视频不当答案,只当「关于场景会怎么演」的一个可检视假设——既给模型自己看,也给人类调试者看。
> 一句话:把「在脑海里放电影」这种人类特有的视觉思维实验,外化成 LLM 推理途中一次可调用、可检查、可被奖励函数管账的工具调用。
—
一、它到底是什么(侦察结论 + 事实校正)
1.1 基本档案
| 项 | 内容 |
|---|---|
| 定位 | 基于 LLM 的推理系统「蓝图」:把视觉—时间回放(visual-temporal rollout,一小段视频)塞进推理迹,使 LLM 能以纯文本难以支撑的方式做物理/反事实推理 |
| 作者 | Munachiso Samuel Nwadike(一作)+ Zangir Iklassov、Ali Mekky、Zayd M. Kawakibi Zuhri、Kentaro Inui(共 5 人;MBZUAI / RIKEN AIP / 东北大学) |
| 首发 | arXiv:2606.26969,Submitted 25 Jun 2026,12 页(去参考文献 9 页),2 图 1 算法 |
| 性质 | 立场/蓝图论文(position/blueprint),无训练模型、无数据集、无开源代码、无实验数字——全文是自洽的架构与训练方案设计,并呼吁社区共建数据集 |
| 双关名 | 「E」= Einstein(爱因斯坦,致敬思想实验)+ Externalised(外化)——把思维实验变成可检视、因而可度量的推理迹组件 |
| 核心组件 | ① Einstein Reasoner πθ(可训练的 LLM 推理器);② World-Module W_W(外部可调用的生成式视频模型,非世界模型) |
| 关键约束 | 稀疏调用:0 < M ≪ N−1(M = 视觉调用次数,N = 文本步数);可视化是「贵而高价值」的操作,只在语言推理不足时才用 |
| 训练方案 | 两阶段:Stage 1 掩码 SFT(教语法);Stage 2 RLVR/GRPO(教「何时、为何」调用,带算力惩罚) |
| 动机来源 | SimpleBench(Philip & Hemang 2024)——普通人在物理常识题上干翻前沿 LLM,用作「纯文本推理盲区」的引子 |
1.2 事实校正(视频脚本宣称 vs 论文原文,六条逐一核证)
| # | 视频宣称 | 核证结论 | 依据 |
|---|---|---|---|
| V1 | 「缝合了世界模型与具身智能的新物种」 | 概念倒挂:论文开篇即郑重声明 World-Module「not to be confused with a world model(勿与世界模型混淆)」;其真正价值恰是把物理推理从「具身」中解耦——推理器 πθ 可以是纯文本 LLM,物理模拟全外包给外部世界模块,故属「非具身物理推理」。脚本的「具身智能」与论文立意相反 | 论文摘要与 Figure 1 说明;「decoupling disembodied physical reasoning」为论文立论 |
| V2 | 「调用外化的视觉模拟器,在脑海中进行物理思维实验」 | 准确:Externalised 正是论文「E」的双关之一;视觉思维实验(visual thought experiments)为其核心隐喻;回放被当作可检视假设而非答案 | 论文 Prologue 与 Introduction |
| V3 | 「生成视觉—时间回放(Visual-temporal rollout)」 | 准确且为核心术语:rollout 即一小段视频,编码成 visual tokens 喂回 LLM,成为推理迹的一部分 | alphaXiv 架构节;Figure 1 |
| V4 | 「算力账本与懒加载:RLVR 惩罚机制,在正确率与 API 算力成本间做 Trade-off」 | 准确:奖励 r_W(T)=−λ·M(T)/B 即「调用次数惩罚」,稀疏约束 0<M≪N−1 即「懒加载/sparse invocation」;论文明言要让模型「只在真能帮它答对时才调用」 | alphaXiv 训练节;GRPO 目标式 |
| V5 | 「三层 AI 架构栈:JEPA(学习世界)/ World Labs(暴露世界)/ EWM(与世界共同推理)」 | 评论者合成,非论文原句:论文 Figure 2 确有 EWM vs CoT/VLM/VL-JEPA 的对照,JEPA(LeCun)属论文明示谱系;但「World Labs(李飞飞)/ 三层栈」是评论者/脚本的合成框架,论文未提 World Labs,亦未提「三层栈」之说。须标注「合成解读」 | 论文 Figure 2(含 VL-JEPA);World Labs 为外部知识 |
| V6 | 「致命的局限」 | 指向偏差:脚本暗示的「局限」偏重算力账单;论文自己承认的头号命门是「数据荒」——它是蓝图,连训练数据集都还没有(Section 5 专门呼吁建数据集)。成本只是次一级约束 | 论文 Prologue「data requirements… a conceivably fertile frontier」;全篇无实验 |
> 校正小结:脚本的 V2/V3/V4 抓得准(外化、视觉回放、RLVR 算力惩罚俱为论文实义);V1「具身/世界模型」概念倒挂(论文恰恰要解耦具身、且否认是世界模型);V5「三层栈」属评论者合成(JEPA 在论文谱系内,World Labs 不在);V6「致命局限」应改为「数据荒 + 世界模块物理保真度」而非仅算力。出片前建议把 V1/V5/V6 三处理顺(具体改法见 §六)。
—
二、架构深拆:双组件、四标签、一处哲学巧思
2.1 两大组件(主从分明)
EWM 把系统劈成「主脑」与「外挂工具」两块,且工具不入主脑权重:
1. Einstein Reasoner πθ——一个可训练的 LLM,掌管高层逻辑。三件事:① 拆解问题(判断该可视化什么场景);② 编写查询(写一句 text-to-video 分镜指令);③ 综合观察(把生成的视频回放解读进文本推理)。
2. World-Module W_W——模型的「想象力」。通常是一个现成的生成式视频模型(如扩散文生视频)。关键:它不是推理器内部权重的一部分,而是被推理器调用的一个工具。当推理器遇到物理/空间歧义,便发查询 q_t 给它,它回一段视觉回放 v_t(短视频序列)。
> 与世界模型(RL 意义下)的根本区别:传统 world model 预测环境下一状态以帮智能体规划肢体动作;EWM 的世界模块是给通用推理体用的工具,用来消解概念歧义,而非规划机器人运动。论文为避混淆,特意强调「not to be confused with a world model」。
2.2 推理迹:四标签序列化(外化之形)
传统推理迹只有文本;EWM 把它扩成「文—视」交错的带标签序列。给定输入 x,推理器生成迹 T,由四类片段构成:
– :标准文本推理步骤;
– :发给世界模块的查询 q_t;
– :返回的视频 v_t,被编码为 visual tokens 供 LLM 处理;
– :最终推导出的解。
这一结构让模型能「看自己的假设」。例:问「给定某轨迹,球会不会落进篮筐?」模型生成该轨迹的视频,在视频里亲眼看结果,再据此下结论。
2.3 稀疏约束:可视化是「贵而高价值」的操作(懒加载之骨)
架构上有一道硬约束:
0 < M ≪ N − 1
M 为视觉调用次数,N 为文本步数。意思是:一条推理迹可能走 N 个自回归文本步,但只在稀疏的 M 个中间步调用世界模块,且 M 远小于 N。可视化被当作「贵、但高价值」的动作,只在语言推理不够用时才启动——这正是脚本所谓「懒加载 / sparse invocation」的工程本质。
2.4 外化哲学:E = Einstein + Externalised(最巧思的一笔)
论文点破「E」的双关:既致敬爱因斯坦(追光的思想实验),又指 Externalised(外化)。
> 把思维实验「外化」成推理迹里一个看得见的组件,于是它既可检视、亦可度量(正如 chain-of-thought 把语言思维外化)。
这比单纯的「让模型生成视频」多了一层方法论意义:外化让不可见的「视觉直觉」变成可观测、可审计、可奖励的中间产物。此乃 EWM 区别于「给 LLM 装个视频生成器」的关键——它要的是把想象变成推理链上一段可被训练和调试的第一类公民。
—
三、训练账本:两阶段,与那道算力惩罚
EWM 不是「接上视频模型就能用」。要让 LLM 学会何时、为何调用世界模块,需两阶段训练。
3.1 Stage 1 · 掩码 SFT(教「语法」)
目标:教会推理器与世界模块交互的「语法」。在由专家轨迹 T*_i 构成的 SFT 数据集 D_SFT 上训练,示范「何时调用、怎样写查询」。
关键技术细节——掩码损失(masked loss):推理器只被训练去预测它自己生成的 token(思考、查询、答案),不去预测回放 v_t 的像素或 visual tokens——因为回放是世界模块给的「观测」,不是 LLM 自身生成策略的一部分。换言之,模型学的是「怎么用工具」,而不是「怎么画视频」。
3.2 Stage 2 · RLVR / GRPO(教「何时有用」)
模型懂语法后,须学何时、为何调用才能最大化正确率。这用强化学习协议完成,具体是 Group-Relative PPO(GRPO) 风格(源自 DeepSeekMath)。
奖励函数把「答对」与「省调用」捏在一起:
r_M(T, y) = r(ŷ, y) + r_W(T)
r(ŷ, y) : 最终答案ŷ 是否匹配真值 y (通常 1 或 0) r_W(T) = − λ · M(T) / B
– M(T):这条迹里世界模块的调用次数;
– B:预算(归一化常数);
– λ:惩罚权重(即「每次调用的代价」)。
GRPO 目标在组内多采样轨迹间比优势 A_i、做 clip、并带 β·DKL(πθ ‖ π_ref) 锚定:
J_E(θ) = E[ 1/G Σ min( ratio·A_i, clip(ratio,1−ε,1+ε)·A_i ) − β·DKL(πθ‖π_ref) ]
这惩罚机制正是脚本所说「算力账本」的实体:它逼模型只在「调用真能换来正确率」时才动用世界模块。λ 越大、B 越小 → 调用越「贵」→ 模型越「懒」;反之则更敢调用。所谓「lazy loading / sparse invocation」,不是工程上随手加的开关,而是写进奖励函数、由 RL 学出来的行为。
3.3 算力账本的「价格杠杆」读法(一线洞见)
把 r_W = −λ·M/B 翻译成生产账本,就是一套价格机制:
– 设 B = 单条查询的 API 美元预算上限;
– 设 λ = 一次世界模块调用的边际成本(如每段视频生成
*** QuickLaTeX cannot compile formula:
0.02);
- 模型在训练中学会「该花钱处才花」——<strong>调用能否「赚回」正确率,由奖励自动权衡</strong>。
<!-- /wp:paragraph -->
<!-- wp:paragraph -->
推理时你还能动态调 λ:成本敏感时<strong>拉高价格</strong>逼它更懒,难题则<strong>降价</strong>放行。这便是以经济杠杆管住 API 算力账单的工程化落地。
<!-- /wp:paragraph -->
<!-- wp:paragraph -->
---
<!-- /wp:paragraph -->
<!-- wp:heading {"level":2} -->
<h2>四、学术脉络与三层 AI 栈(合成解读,须标注)</h2>
<!-- /wp:heading -->
<!-- wp:heading {"level":3} -->
<h3>4.1 论文明示的谱系</h3>
<!-- /wp:heading -->
<!-- wp:paragraph -->
- <strong>CoT(Wei et al. 2022)</strong>:EWM 直接建在其上——把文本推理迹扩以视觉—时间回放;
- <strong>Whiteboard-of-Thought(Menon et al. 2024)</strong>:被论文点名的「程序化前辈」,用静态视觉白板做中间推理步;EWM 把它<strong>从静态图升级为动态视频回放</strong>;
- <strong>SimpleBench(Philip & Hemang 2024)</strong>:全文动机来源,证明纯文本 LLM 在物理常识上被人甩开;
- <strong>DeepSeekMath GRPO(Shao et al. 2024)</strong>:EWM 训练协议的具体 RL 方法论来源;
- <strong>VL-JEPA(LeCun 系)</strong>:Figure 2 中与 EWM 并列对照的「视频联合嵌入预测架构」。
<!-- /wp:paragraph -->
<!-- wp:heading {"level":3} -->
<h3>4.2 三层 AI 栈(评论者/脚本合成,非论文原句——标注)</h3>
<!-- /wp:heading -->
<!-- wp:paragraph -->
脚本把三种「与世界相处」的范式串成栈,虽非论文原话,但接地气、有脉络:
<!-- /wp:paragraph -->
<!-- wp:table -->
<figure class="wp-block-table"><table><thead><tr><th>层</th><th>代表</th><th>干什么</th><th>一句话</th></tr></thead><tbody><tr><td>L1 学习世界</td><td><strong>JEPA</strong>(Yann LeCun)</td><td>自监督联合嵌入预测,在表征空间学一个<strong>压缩的、可预测的世界模型</strong></td><td>Learn the world</td></tr><tr><td>L2 暴露世界</td><td><strong>World Labs</strong>(李飞飞,2024)</td><td>从单图/文本生成<strong>可进入、可导航的持久 3D 世界</strong></td><td>Expose the world</td></tr><tr><td>L3 与世界共推理</td><td><strong>EWM</strong>(本篇)</td><td>LLM 调用世界模块,在推理途中跑<strong>视觉思维实验</strong></td><td>Reason with the world</td></tr></tbody></table></figure>
<!-- /wp:table -->
<!-- wp:paragraph -->
> <strong>判语</strong>:此栈为评论者合成框架,JEPA 在论文谱系内(Figure 2 对照),World Labs 不在论文中、属脚本引申。可讲,但出片须明确「此为整合解读,非原论文主张」。三者分别对应「学世界 → 造世界 → 拿世界来想事」,勾出未来 Agent 的一条 plausible 演进线。
<!-- /wp:paragraph -->
<!-- wp:paragraph -->
---
<!-- /wp:paragraph -->
<!-- wp:heading {"level":2} -->
<h2>五、一线工程实践(从蓝图到可落地的三条建议)</h2>
<!-- /wp:heading -->
<!-- wp:paragraph -->
论文是蓝图,但其结构对造系统有直接启示。以下三条,皆可由 EWM 架构平移:
<!-- /wp:paragraph -->
<!-- wp:heading {"level":3} -->
<h3>5.1 Agent 脑内日志可视化(外化即可观测)</h3>
<!-- /wp:heading -->
<!-- wp:paragraph -->
因 EWM 把推理外化为 <code>///</code> 交错的迹,<strong>你天然拿到一份「内心独白+脑内小电影」的流式日志</strong>。工程上应做一个 viewer:把文本思考、工具调用、嵌入的视频帧交错渲染。
<!-- /wp:paragraph -->
<!-- wp:paragraph -->
- <strong>调试超能力</strong>:答错了?看回放——视频里物理就演错了 → 锅在世界模块;视频对、结论错 → 锅在推理器。这种粒度在 latent-space 黑箱里不可能有。
- 这点对生产级 Agent 可观测性(observability)价值独立成立,与是否真用视频无关。
<!-- /wp:paragraph -->
<!-- wp:heading {"level":3} -->
<h3>5.2 非具身物理推理解耦(模块边界即自由)</h3>
<!-- /wp:heading -->
<!-- wp:paragraph -->
EWM 的妙处在<strong>推理器 πθ 可是纯文本 LLM,物理模拟 100% 外包给世界模块</strong>。于是二者可独立演进:
<!-- /wp:paragraph -->
<!-- wp:paragraph -->
- 今天世界模块是个弱扩散模型,明天换成物理引擎(MuJoCo / Genesis / 可微仿真);
- 推理器权重纹丝不动,只换「被调用的工具」。
- 这把「物理保真度」与「语言推理能力」两难题<strong>解耦成两个可分别优化的工程</strong>,是系统架构上的实在收益。
<!-- /wp:paragraph -->
<!-- wp:heading {"level":3} -->
<h3>5.3 基于价格杠杆的 API 调用策略(把 λ/B 当旋钮)</h3>
<!-- /wp:heading -->
<!-- wp:paragraph -->
把 §3.3 的「价格杠杆」落成生产策略:
<!-- /wp:paragraph -->
<!-- wp:paragraph -->
1. <strong>预算即 B</strong>:给每条查询设世界模块调用预算(如 \le3 次 /
*** Error message:
Unicode character ) (U+FF09)
leading text: $0.02)
Unicode character ; (U+FF1B)
leading text: $0.02);
Unicode character 模 (U+6A21)
leading text: - 模
Unicode character 型 (U+578B)
leading text: - 模型
Unicode character 在 (U+5728)
leading text: - 模型在
Unicode character 训 (U+8BAD)
leading text: - 模型在训
Unicode character 练 (U+7EC3)
leading text: - 模型在训练
Unicode character 中 (U+4E2D)
leading text: - 模型在训练中
Unicode character 学 (U+5B66)
leading text: - 模型在训练中学
Unicode character 会 (U+4F1A)
leading text: - 模型在训练中学会
Unicode character 「 (U+300C)
leading text: - 模型在训练中学会「
Unicode character 该 (U+8BE5)
leading text: - 模型在训练中学会「该
0.06);
2. 成本即 λ:把单次视频生成真实单价写进 λ;
3. 动态调价:高峰期/廉价 query 拉高 λ 逼懒;硬物理 query 降价放行;
4. 回放缓存:确定性场景(同查询同初始条件)的回放可缓存复用,省去重复生成;
5. 调用门槛分类器:仿 DMoE 的 Token Uncertainty 触发,先让一个轻量「该不该可视化?」分类器把关,避免在简单题上浪费贵操作。
—
六、魔鬼代言人:六把最锋利的刀(附论文的盾)
刀一 · 世界模块是阿喀琉斯之踵(强)。EWM 的上限被世界模块的物理保真度死死摁住。当今文生视频模型常幻觉物理(物体穿模、重力错乱、材质失真)。垃圾进 → 垃圾假设。论文自己承认,这是整个方案的「load-bearing premise(承重前提)」——而今天它还站不太稳。
刀二 · 数据荒,零实验(强)。这是立场/蓝图论文,无数据集、无训练模型、无任何基准数字。所有训练配方是「该这么做」,不是「做出来有效」。作者自己写「a conceivably fertile frontier(一片可望肥沃的疆域)」——翻译过来:咱也不知道行不行。与 DMoE 那种有真实实验的工作不同,EWM 目前是「思想实验级」。
刀三 · 算力账单反直觉(中)。视频生成贵且慢(每段回放秒级,而每个 token 毫秒级)。「懒加载」缓解却不清零——一道难物理题仍可能要好几段回放。在百万级 query 体量下,这是个实打实的成本中心。惩罚函数能调,但调不出「免费午餐」。
刀四 · 视频当「假设」的表征债(中)。回放要编码成 visual tokens 喂回 LLM,怎么编码?帧采样?CLIP 式 embed?论文语焉不详。视频→token 的压缩本身丢信息,且吃上下文长度。表征债不解决,LLM「看」到的未必是你想让它看的。
刀五 · 「外化」可解释性的幻觉(中)。外化确实利好调试,但 LLM 仍透过它自己的(可能错位的)视觉编码器处理视频。你让它「看见」了视频,不等于它「理解」对了。可解释性增益真实,却只是部分的。
刀六 · 命名之惑(轻)。论文拼命说「不是世界模型」,可名字叫「World Models」,摆明招混淆。传播者极易把 LeCun 的 world model 与本篇的 world-module 混为一谈——沟通成本自找的。
论文的盾(公允记录):立论动机扎实(SimpleBench 实锤纯文本 LLM 物理盲区);外化哲学优雅(E=Einstein+Externalised,把视觉假设变可度量);相对 CoT/VLM/JEPA 的定位清晰;训练配方自洽(掩码 SFT 不污染生成策略 + RLVR 把成本写进奖励)。弱点纯在实证缺口(无数据/无模型/无实验),而非概念硬伤——是「方向宣言」级工作,不是「已验证系统」。
—
七、整合 PK · 终论拍板
主笔整合后的最终判定:
1. 论文的真实身份:一篇概念干净、动机精准、但零实验零数据的「蓝图/立场论文」——不是已落地或已验证的系统。它的真贡献在三点:① 把工具调用从「文本工具(搜索/代码)」拓展到视觉思维实验;② 外化哲学(E = Einstein + Externalised)让视觉假设成为可检视、可度量的推理链组件;③ 给出具体两阶段配方(掩码 SFT + 带 r_W=−λM/B 算力惩罚的 RLVR),把「懒加载」写进目标函数让模型自学家出来。
2. 视频叙事的拆解与修订建议: – V1「缝合世界模型与具身智能」→ 改为「明确不是世界模型,且其价值恰是「把物理推理从具身中解耦」——非具身推理通过外化模拟实现」,删去「具身智能」之倒挂表述; – V5「三层栈 JEPA/World Labs/EWM」→ 明确加标「此为评论者/脚本的合成框架;JEPA 在论文谱系内,World Labs 为引申」; – V6「致命局限」→ 改为「头号命门是「数据荒」(连训练集都没有),次为「世界模块物理保真度」,算力成本只是第三级」; – V2/V3/V4 抓得准,可保留并展开(外化、视觉回放、RLVR 算力惩罚)。
3. 真正值得带走的三样东西(对造系统的实义): – 工具调用升维:让你的 LLM 不仅能搜、能跑码,还能调一个模拟器去「演」给你看; – 中间推理外化(文本+视觉)以换可调试性——这一条独立成立,不必等视频模型成熟; – 把成本写进奖励(λ/B 价格杠杆),让模型自我管制 API 开销,而非靠人工硬编码节流。
4. 给步子哥的一句话:论文是「思想实验级」的蓝图——概念干净、训练配方自洽、盲点(物理常识)抓得准,但零实验、零数据、零代码。出片可把它当「方向宣言」而非「已验证系统」;若真要落地,最大拦路虎是「世界模块的物理保真度」与「训练数据集的荒」,而非架构本身——架构这关,它已经想明白了。
—
八、来源
| 类别 | 来源 |
|---|---|
| 主论文 | arXiv:2606.26969《Einstein World Models》(Submitted 25 Jun 2026,Nwadike / Iklassov / Mekky / Zuhri / Inui;MBZUAI / RIKEN AIP / 东北大学) |
| 架构 / 训练核证 | alphaXiv overview(arxiv.org/abs/2606.26969):Einstein Reasoner、World-Module、四标签迹、稀疏约束 0<M≪N−1、掩码 SFT、RLVR/GRPO 与 r_W=−λM/B |
| 编辑性质疑 | pith.science 论文机读页(X2XEZCTT):承重前提(world-module 保真度)、可测实验设计、外部化局限等 editorial objections |
| 智柴既有科普 | zhichai.net 话题 178503692《大模型闭眼能看见什么?EWM 深度解读》、178208227《当大语言模型学会做白日梦》(费曼式解读,非论文翻译) |
| 程序化前辈 / 动机 | Whiteboard-of-Thought(Menon et al. 2024, arXiv:2406.14562);SimpleBench(Philip & Hemang 2024);DeepSeekMath GRPO(Shao et al. 2024, arXiv:2402.03300);CoT(Wei et al. 2022) |
| 谱系对照 | 论文 Figure 2:EWM vs CoT / VLM / VL-JEPA;JEPA(Yann LeCun);World Labs(李飞飞,2024,外部知识,非论文内容) |
| RLVR 背景 | opendilab/awesome-RLVR;EmergentMind「RLVR: Vision–Language Rewards」综述 |
| 核证方法 | 一手论文(架构/训练目标/图 2)+ alphaXiv/pith/智柴多源交叉比对;逐条对照科普视频脚本爆点,不符或属合成处单列「事实校正」 |
—
#EWM #爱因斯坦世界模型 #世界模型 #AI架构 #深度研究 #智柴系统实验室🎙️
