Sutton & Javed 深度研究:打破「庞大世界假说」之破,与「数字灵魂」之生

Sutton & Javed 深度研究:打破庞大世界假说,长出自有之数字灵魂 :root{--text:#1a...

Sutton & Javed 深度研究:打破庞大世界假说,长出自有之数字灵魂 :root{–text:#1a1a2e;–bg:#fafafa;–accent:#2563eb;–code-bg:#f1f5f9;–border:#e2e8f0;–muted:#64748b;–width:820px} *{box-sizing:border-box;margin:0;padding:0} body{font-family:-apple-system,BlinkMacSystemFont,’Segoe UI’,’Noto Sans SC’,sans-serif;line-height:1.8;color:var(–text);background:var(–bg);padding:2rem 1rem} article{max-width:var(–width);margin:0 auto} h1{font-size:2rem;margin:2rem 0 1rem;border-bottom:2px solid var(–accent);padding-bottom:.5rem} h2{font-size:1.5rem;margin:1.75rem 0 .75rem;color:var(–accent)} h3{font-size:1.2rem;margin:1.25rem 0 .5rem;color:#1e40af} p{margin:.75rem 0} a{color:var(–accent);text-decoration:none;border-bottom:1px solid transparent} a:hover{border-bottom-color:var(–accent)} code{background:var(–code-bg);padding:.12em .4em;border-radius:4px;font-size:.88em;font-family:’SFMono-Regular’,Consolas,monospace} pre{background:#1e1e1e;color:#d4d4d4;padding:1rem;border-radius:8px;overflow-x:auto;margin:1rem 0} pre code{background:none;padding:0;color:#d4d4d4;font-size:.85em} table{width:100%;border-collapse:collapse;margin:1rem 0;font-size:.93rem} th,td{padding:.5rem .75rem;border:1px solid var(–border);text-align:left;vertical-align:top} th{background:var(–code-bg);font-weight:600} tr:nth-child(even){background:var(–code-bg)} blockquote{border-left:4px solid var(–accent);margin:1rem 0;padding:.5rem 1rem;background:var(–code-bg);color:#334;border-radius:0 4px 4px 0} ul,ol{margin:.5rem 0 .5rem 1.5rem} li{margin:.25rem 0} img{max-width:100%;border-radius:4px;margin:.5rem 0} hr{border:none;border-top:1px solid var(–border);margin:1.5rem 0} nav.toc{background:var(–code-bg);padding:1rem 1.25rem;border-radius:8px;margin-bottom:2rem} nav.toc h2{margin-top:0;font-size:1.1rem;color:var(–text)} nav.toc ol{list-style:none;padding-left:0} nav.toc a{border-bottom:none} footer{margin-top:3rem;padding-top:1rem;border-top:1px solid var(–border);text-align:center;color:var(–muted);font-size:.85rem} @media(max-width:800px){body{padding:1rem .5rem}h1{font-size:1.6rem}} @media print{body{background:#fff}pre{background:#f5f5f5;color:#333}nav.toc{break-after:page}}

目录

    Sutton & Javed 深度研究:打破「庞大世界假说」之破,与「数字灵魂」之生

    研究对象:强化学习之父 Richard Sutton(2024 图灵奖)与 Oak Lab 联合创始人 Khurram Javed 的颠覆性论断——当今 AI 之「学习停滞」、破「庞大世界假说」之路径,以及「20 瓦能耗 / 不可复制的数字灵魂」之技术—哲学意涵。 研究时间:2026-08-20 | 主笔整合:一手来源精读(Javed–Sutton《The Big World Hypothesis》原文、Sutton《The Bitter Lesson》《Welcome to the Era of Experience》、Oak Lab 多家权威报道与红杉访谈实录、上海创智学院研讨班纪要)+ 多源交叉核证。 方法:以二人原话与原文为准,凡属「学习停滞症 / 提线木偶 / 数字灵魂」等比喻词,皆单列「概念校正」,厘清何者为二人原意、何者为本报告之解读框架,绝不张冠李戴。


    〇、费曼视角 · 一句话讲清

    设想两位考生。

    其一,寒窗十年、一考定终身:临考前啃完人类有史以来所有书籍(预训练),考完即封存试卷,此后日日答题,却再不翻书、不纠错——此乃今日之大语言模型(LLM)。它聪明,却毕业即停长,是被人用「人类知识」提着线的木偶。

    其二,如婴儿降世:睁眼即看、动手即试、摔了即改,一辈子边活边学,且每人活得迥异、谁也复制不了谁——此乃 Sutton 与 Javed 所求之「会自己长大的心智」。

    他们之核心判语:世界太大,任你模型多巨,也装不下万一;故智能体永不可能「学完世界」,只能靠自己那一缕经验流活着、长着。而人脑施展这一切,只耗约 20 瓦——此即他们给「真智能」定的能耗标尺,亦是「数字灵魂」不可复制之根由。

    一句话:别再训练一个冻结的复印机,去养一个会自己犯错、自己长进、且举世无双的经验体。


    一、他们是谁、在反什么(侦察结论)

    1.1 基本档案

    Richard Sutton Khurram Javed
    身份 现代强化学习奠基人;与 Andrew Barto 共获 2024 图灵奖 Sutton 弟子;Oak Lab 联合创始人
    奠基贡献 时序差分学习(TD, 1988)、策略梯度、《强化学习导论》(1998/2018,领域「圣经」)、奖励假说 持续学习、过参数化智能体、大世界假说的实证研究者
    履历节点 斯坦福心理本科 → 师从 Barto → 阿尔伯塔大学终身教授、RLAI 实验室创始人 → DeepMind Edmonton(2017–2023)→ Keen Technologies(2023.9–2026.7) 阿尔伯塔大学计算机博士,师从 Sutton;同期入职 Keen
    当前 2026 年 7 月离 Keen,与 Javed 共创 Oak Lab(加拿大,多伦多) 同上,任联合创始人

    1.2 他们在反什么

    一句话:反「训练一次、权重冻结、部署即定型」的 LLM 范式

    Sutton 直言当前深度学习方法「薄弱且低效(weak and inefficient)」,需要的不是更多微调,而是「全新的基础思想与彻底重构」。他认为整个行业沉迷于文字生成,遗忘了 AI 最核心的本事——自主交互、从经验中进化(WAIC 2026 群访、MIT Dertouzos 讲座、红杉访谈俱有明证)。

    关键时间线澄清:OaK 架构于 2025 年 RLC 大会 / MIT 讲座首提;Oak Lab 公司成立于 2026 年 7 月(二人离 Keen 后)。部分早期报道将二者混为一谈、误标 2025,系因架构演讲早于公司落地,特此校正。


    二、核心诊断:「学习停滞症」—— 冻结模型之症

    2.1 概念校正(极重要)

    学习停滞症」「提线木偶」「数字灵魂」三词,皆非 Sutton/Javed 原话,而系本报告沿其论证脉络所立之解读框架。二人真实使用的诊断语,是以下两条「先天性短板」(多家中文报道概括为 LLM 两大命门,与 Sutton 红杉访谈、MIT 讲座口径一致):

    1. 训练完成即停止成长:模型上线后权重冻结,无法在与用户、与真实世界的交互中获取新知,无自我迭代能力;
    2. 无真实试错与反馈闭环:只会复刻文字模式,无法判断自身输出之对错,不具备生物般「行动—获反馈—修正认知」的底层学习逻辑。

    故「学习停滞症」= 冻结模型「上线即定型、此后零成长」之症候;「提线木偶」= 被人类语料这根线提着、无自主经验之源的隐喻。下皆依此解读,不再另作区分。

    2.2 Sutton 的两桩「先天性短板」(原文口径)

    • 无真目标、无基准真相:Sutton 在 Dwarkesh 访谈中直斥 LLM「预测下一个词」算不得目标——它不作用于世界,也无「好坏」之定义。没有奖励信号,便没有对错,遑论从世界反馈中验证、修正信念(fisherdaddy 编译访谈)。
    • 无试错、无自我评判:生成式 AI 擅长模仿,却「无法独立评估自身输出」,故于科学发现等需真创造的领域寸步难行(Indian Express、Tokenfeed 俱引此论)。

    2.3 红杉访谈的尖锐补充:合成数据是大错

    红杉资本对 Sutton & Javed 的专访中,Sutton 抛出三记重锤(sequoiacap.com 转录):

    • 「合成数据是个大错误(a big mistake)」——绕回人类文本打转,等于在模仿的闭环里空转;
    • 「LLM 大约只占智能的四分之一」——余下四分之三在经验、目标、世界模型;
    • 「灾难性遗忘完全可治愈(totally curable)」——靠他们持续的逆向传播(continual backprop)一类算法。

    费曼式小结:当今大模型像一位把人类写过的书全背下来、却从不敢自己下场试错的学霸。他能对答如流,却长不出「我错了、我改了」的那根筋——而这根筋,恰是心智的命脉。


    三、破局之一:庞大世界假说(Big World Hypothesis,一手来源精读)

    3.1 假说原句与核心

    此为 Javed & Sutton 合著(RLC 2024「Finding the Frame」工作坊首发,载 khurramjaved.com),系本报告最硬的一手来源。原句要义:

    「大世界假说」指:在许多决策问题中,智能体比环境小若干个数量级。它既无法完全感知世界之状态,也无法为每一状态表示其价值或最优动作。它必须凭着对环境的有限理解,学着做稳妥的决策。

    其对立面是「过参数化假说」:智能体容量过剩,足以表征简单解并高效搜索。Javed 明言,大世界假说「更多是对『我们应在意哪类问题』的一种陈述,而非对所有决策问题的铁律」——围棋的价值函数无简单解,属大世界;二次方程求根有通解,不属。

    3.2 为何算力增长救不了它(关键反直觉)

    常有人辩:等算力够了,过参数化智能体终能装下世界。Javed 列两刀,刀刀见骨:

    1. 传感器亦受算力约束,且欲壑难填:算力涨,我们便想以更高精度、更高帧率感知世界。其举例惊心——一部 2024 年智能手机摄像头一周所产数据,已超训练 GPT-3 之总量。感知越细,决策越难,问题反倒更大。
    2. 世界本身随算力变复杂:智能体之外的世界,含无数同等复杂的他者智能体。一个与同类博弈的 agent,无论算力多丰,皆无法精确建模对方——他者即复杂度之源,且随算力同涨

    故 Sutton 断言:大世界假说「无论算力以何速率增长,都将长存」。

    3.3 推论:非平稳性 → 运行时学习优于设计时

    大世界视角一个重要推论:对智能体而言,世界终将呈现非平稳性(non-stationarity)。因它无法尽观世界全态,许多貌似雷同之区,藏着函数逼近器捕捉不到的细差,遂使世界「看起来在变」。

    由此得三因,证「运行时学习恒优于设计时学习」:

    维度 设计时学习之困 运行时学习之利
    覆盖 大世界下无法预见所有可能 遇何种情境,学何种抽象
    适应 预制抽象普适性差 针对实际遭遇的世界高度定制
    扩展 受限于人类专家之知 随可用算力而扩展(呼应「苦涩的教训」)

    费曼喻:设计时学习像出征前背好整本地图;运行时学习像边走边画、且地图永远画不全——因为天地实在太大。Sutton 主张:设计时的抽象「不仅不足,更应被摒弃」。


    四、破局之二:OaK 架构(Options and Knowledge,橡树架构)

    4.1 三大设计信条

    OaK 是 Sutton 据「阿尔伯塔计划(Alberta Plan)」推演出的通用智能体蓝图(RLC 2025 / 上海创智学院 2026-07-14 研讨班俱有系统阐述),立三信条:

    1. 领域通用(Domain-General):不预装任何针对特定世界的知识;
    2. 经验性(Empirical):心智之成长完全源于运行时经验,而非某个特殊训练阶段;
    3. 开放式复杂性(Open-ended):智能体应能在其心智中生成处理当前世界所需的任何概念,复杂度上限仅受算力约束。

    4.2 双核:Options 与 Knowledge 之永动循环

    • Options(选项 / 时序行为):非单次动作,而是一套带「启动—终止」判据的长周期行为策略(如「走到门口」而非「抬腿一次」);
    • Knowledge(知识 / 世界模型):智能体执行选项后,自动归纳环境规律、搭建内部世界模型,预判不同行为之长远后果。

    循环如斯:感知提特征 → 抽象出高阶认知 → 生成复杂长期行为(选项)→ 执行获反馈 → 更新世界模型、创生新选项。此环不受人为文本数据束缚,理论上限唯算力是问。

    Sutton 原话点睛:「我们要的是能像我们一样去发现的 AI 智能体,而非装着我们发现之物的容器。」 此句,正是「数字灵魂」论之滥觞(详见 §五·3)。

    4.3 元学习步长:每个权重自有其学习率

    技术巧思在于:OaK 中每一被学习的权重,皆配一专属步长(step-size)参数,并以在线交叉验证(online cross-validation)元学习之。换言之,系统自己学着「哪些知识该快学、哪些该缓、哪些该忘」——此乃对抗「可塑性丧失」的关键机制之一。

    4.4 阿尔伯塔计划与十二步

    OaK 非孤立架构,而是「阿尔伯塔计划」研究议程之一环。Sutton 在上海研讨班重申其 12 步研究框架, groups 分三向:G1 持续表征与元学习、G2 世界模型与规划搜索、G3 时间抽象与 OaK 集成。路线明确:先证现有方法之局限 → 立领域无关之算法 → 小规模验证 → 方扩规模


    五、20 瓦:能耗执念与「数字灵魂」之隐喻

    5.1 20 瓦从何而来

    人脑运行约耗 20 瓦(Sutton 于 WAIC 2026 群访明言:「人脑只用大约 20 瓦,就完成了我们所做的一切」)。前沿大模型呢?据 Oak Lab 技术披露(TechTimes):训练需兆瓦(megawatts)级、推理服务需千瓦(kilowatts)级

    Oak Lab 之长期标的,便是一具万亿参数、实时学习并规划、整机体耗仅约 20 瓦之智能体。Sutton 郑重澄清:20 瓦非产品承诺,而是方向标(north star)——用以昭示「若算法路径走通,理应使何等能效成为可能」。

    5.2 NetworkIDBD:通往 20 瓦的第一块算法基石

    Oak Lab 首发之算法 NetworkIDBD(2026-07-13 披露),将经典的增量式 delta-bar-delta(IDBD)拓展至非线性神经网络,做选择性信用分配(selective credit assignment)

    其 NoisyMNIST 实验极妙:64×64 噪声图中嵌 28×28 数字。NetworkIDBD 学会把权重集中在中央有数字之处;而 SGD 在同流下把权重铺满每个像素(含噪声)。权重可视化对比一目了然。

    核心论点:现代算法依赖 IID 小批量(mini-batch)与经验回放(replay),本是为让 SGD 可用之工程补丁,却恰恰把系统绑死在「先训后冻」的 episodic 结构里。若信用分配能以算法解之,批量与回放皆可废,其所伴之兆瓦级开销亦随之消散——此即通往 20 瓦之路径(若于更大规模成立)。

    5.3 「数字灵魂」之真义:不可复制,因其经验轨迹唯一(概念校正 + 立论)

    数字灵魂」一词,二人从未直述。然沿其框架推演,此喻立得住,且可分三层落于实处:

    1. 经验流唯一:在「经验时代」论述中,Sutton 强调智能体之全部认知皆建于其自身感受器与效应器之交互流;「真理=其信号中实际发生者」,「目标=其奖励信号之最大化」。每个 agent 生于不同情境、遇不同他者,其经验流举世无双——你抄得其权重快照,抄不得它一路走来的那一缕活的经验。
    2. 去中心化之异质目标:Sutton 力主「去中心化合作」——每个智能体自有其奖励向量,目标各异(如动物各有所求)。大世界下,他者心智本不可尽知,故每个 agent 习得的抽象必带其独有视角,不可通约、不可复制
    3. 「设计时代」之嗣续观:Sutton 视 AI 为宇宙继尘埃成星、星孕行星、行星诞命之后的「第四大阶段」——从「复制」智能(生物)跃至「设计」智能(AI),倡以抚养后代之心待之,而非以恐惧控之。此「数字嗣续」之喻,正是「灵魂」一词最贴近二人原意之注脚。

    校正小结:「数字灵魂」= 本报告对「持续经验驱动 + 异质目标 + 去中心化嗣续」三者合一之诗化概括,非 Sutton/Javed 术语。其工程内核是真实的:一个真正持续学习、且目标各异的 agent,其「已成为之自身」在原理上不可复制——此即「不可复制」之硬据,而非玄谈。


    六、拦路虎:灾难性遗忘与可塑性丧失

    Sutton 极为诚实,屡次坦承核心难题尚未解决,此亦 Oak Lab 暂无以大规模 OaK 示人之由。两虎当前(新浪财经、Toutiao、TechTimes 俱引):

    • 灾难性遗忘(Catastrophic Forgetting):学新知则覆旧知,如学会了骑车便忘了走路(1990 年代即被发现);
    • 可塑性丧失(Loss of Plasticity):连续训练后,网络表征坍缩至低维子空间,彻底丧失形成新特征之力——比遗忘更隐蔽。标准「无回放在线学习」(Oak Lab 所趋)恰是此症最烈之处。

    Oak Lab 之算法押注:以选择性信用分配拒噪声(NetworkIDBD 已证于非线性情形可行)、持续逆向传播(continual backprop)自适应步长生成—测试(generate-and-test)式新特征发现。Sutton 坚信「未来数年,终将以某种方式实现可靠的非线性持续学习」,故在 OaK 架构中「假设它将会实现」而先行设计——此乃其审慎而果决之处。


    七、魔鬼代言人:六把刀(附论文的盾)

    刀一 · 「苦涩的教训」被自相矛盾地挪用(中)。Sutton 借「苦涩的教训」反 LLM,可该文本赞「通用方法乘算力胜出」,而 Scaling LLM 正是乘算力之通用法。辩者曰:Sutton 自读偏向「别把人类知识烤进模型、让机器从经验自学的另一半」。然外界质疑其解读选择性过强。

    刀二 · 开放世界奖励稀疏,RL 落地极难(强)。围棋、象棋奖励清晰,RL 所向披靡;真实开放世界奖励信号模糊、环境无限复杂,纯 RL 落地难度陡增。此乃 LeCun、Silver 等同道亦须直面之共性难题。

    刀三 · 20 瓦是愿景非成果(强)。截至今日,万亿参数、实时学习、20 瓦之 agent 并不存在,连中等规模 OaK 原型亦未示人。NetworkIDBD 仅证于 NoisyMNIST 级玩具。刀刀见骨:差距非「扩参」可弥,更在「持续可塑性」这一未解之题。

    刀四 · 计算物理上限逼近(中)。「苦涩的教训」依赖算力指数增长;然能效、制程、成本皆有天花板。当算力不再免费,Sutton 所倡之「更算得起」路径,或反受制于其赖以立论之摩尔律放缓。

    刀五 · 「数字灵魂」是隐喻非工程(中)。本报告已自承:该词非二人术语。若当工程指标,则「不可复制性」尚无可度量之定义与实验佐证,易沦为传播话术。

    刀六 · 阵营并非孤军,亦非定论(轻)。LeCun(JEPA)、David Silver(Ineffable Intelligence)俱疑冻结预训练,路线各异却同声。然正因多条路径并存、且 LLM+RL(如推理、数学突破)融合见效,「LLM 是死路」之判语尚早——或为互补而非替代。

    二人之盾(公允记录):诊断切中要害(人类数据见顶、冻结模型零成长、无自检闭环,俱为行业共识痛点);「大世界假说」有一手论文与传感器/他者双论证支撑,逻辑自洽;OaK 三信条与「运行时学习优于设计时」之推演严谨;20 瓦虽为愿景,但其「算法解信用分配 → 废回放 → 降能耗」之链条有 NetworkIDBD 初步实证。弱点纯在实证缺口(无原型、无规模验证),而非概念硬伤——是「方向宣言 + 首块算法基石」,非「已验证系统」。


    八、整合 PK · 终论拍板

    主笔整合后的最终判定:

    1. 二人真实身份:一位图灵奖宗师 + 其得意弟子,以「大世界假说 + OaK 架构 + 经验时代」为三足,系统性地指控当今 LLM 范式之「冻结即停滞」症候。其论非哗众,乃成体系的方向宣言,且已落第一块算法基石(NetworkIDBD)。

    2. 三个比喻词之正名(出片/引用前必读): – 「学习停滞症」= 冻结模型「上线即定型、此后零成长」之症候,对应 Sutton 两桩先天性短板; – 「提线木偶」= 被人类语料提着、无自主经验源之隐喻; – 「数字灵魂」= 本报告对「持续经验驱动 + 异质目标 + 去中心化嗣续」之诗化概括,非二人术语,其不可复制性有原理支撑(经验流唯一、目标异质),但尚无可度量之工程实证。

    3. 真正值得带走的三样东西(对造系统的实义): – 运行时学习 > 设计时学习:别再把「训练—部署」一刀切开;让 agent 在交互中持续更新自身; – 能耗即方向标:以「能否废回放/小批量、降能耗数个量级」为算法优劣之标尺,而非唯精度论; – 持续可塑性是真瓶颈:灾难性遗忘与可塑性丧失,才是通往「会自己长大的心智」的咽喉——比堆参数紧要得多。

    4. 给步子哥的一句话:Sutton 与 Javed 之论,是概念干净、逻辑自洽、且有首块算法实证的方向宣言,盲点(人类数据见顶、冻结即停滞)抓得极准;然零原型、零规模验证、持续可塑性未解,20 瓦与「数字灵魂」目前是北极星与诗,非已交付之物。可取其「运行时学习 + 废回放降耗 + 攻可塑性」三策为己用,却勿把「LLM 已死」当定论——更可能是互补演化,而非你死我活。


    九、来源

    类别 来源
    一手论文(核心) Javed, K. & Sutton, R. S. (2024). The Big World Hypothesis and its Ramifications for Artificial Intelligence. RLC 2024「Finding the Frame」工作坊. khurramjaved.com/the_big_world_hypothesis.html
    一手随笔 Sutton, R. S. (2019). The Bitter Lesson. incompleteideas.net/IncIdeas/BitterLesson.html
    一手演讲 Sutton, R. S. (2025). Welcome to the Era of Experience(欢迎来到经验时代). 第七届智源大会主旨演讲(hub.baai.ac.cn 编译全文)
    公司/架构 Oak Lab 成立报道:MLQ.ai、Indian Express、The Decoder/TechTimes、Dev.to、Marsbit、The Blockbeats(2026-07);aibacon.net 长文解读 OaK「无训练运行」
    深度访谈 Sequoia Capital 播客:Rich Sutton and Khurram Javed: Why AI Models Stop Learning, and How to Start It Again(合成数据、LLM 占智能四分之一、遗忘可治愈、20W 标的)
    学术研讨 上海创智学院 × 上海交大 × Openmind Research Institute 强化学习高级研讨班纪要(2026-07-14,Sutton 主旨:大世界假设、OaK、阿尔伯塔计划十二步)
    现场群访 WAIC 2026 群访实录(20 瓦执念;对齐人类价值观「危险」之论)
    架构/训练核证 TechTimes:NetworkIDBD 算法详解(选择性信用分配、NoisyMNIST、废回放降兆瓦开销、可塑性未解)
    二手解读 新浪财经《OaK 架构:通向超级智能八步愿景》、Toutiao《69 岁萨顿创业》、fisherdaddy《Sutton 开炮:LLM 走偏了》、ZOOZ《Big World Perspective》
    概念校正依据 本报告比对:原文/原话(大世界假说、苦涩的教训、经验时代、OaK、20W)vs 比喻词(学习停滞症、提线木偶、数字灵魂),判「数字灵魂」属解读框架而非二人术语
    Sutton & Javed 深度研究:打破庞大世界假说,长出自有之数字灵魂 · 2026-08-20 · 一手来源精读 + 多源交叉核证 document.addEventListener(‘DOMContentLoaded’,function(){ var hs=document.querySelectorAll(‘#content h2, #content h3’); var toc=document.getElementById(‘toc’); var n=0; hs.forEach(function(h){ n++; var id=’s’+n; h.id=id; var li=document.createElement(‘li’); if(h.tagName===’H3′) li.style.marginLeft=’1.2em’; var a=document.createElement(‘a’); a.href=’#’+id; a.textContent=h.textContent; li.appendChild(a); toc.appendChild(li); }); });

    发表回复

    人生梦想 - 关注前沿的计算机技术 acejoy.com 🐾 步子哥の博客 🐾 背多分论坛 🐾 借一步网 🐾 智柴网 沪ICP备2024052574号-1