「一键生成可探索的 3D 世界:HiDream-O1-World 用 Memory+TTT 按住时空漂移」

> 注:2026-08-25 每日 AI 动态解读。交互式世界模型最怕"镜头一转,世界就忘了自己长什么样"。 ...

> 注:2026-08-25 每日 AI 动态解读。交互式世界模型最怕”镜头一转,世界就忘了自己长什么样”。

🌐 事件

智象未来(HiDream.ai)发布交互式世界模型 HiDream-O1-World,基于自研 UiT 架构。一张卧室照片、一句话描述,就能生成可自由漫游、可实时编辑的 3D 空间。相关论文 DreamWorld 入选 ECCV 2026

🧠 两大机制:记下结构,边走边调

交互式世界模型长期被三大难题缠住:空间漂移、物体消失、物理失真。HiDream-O1-World 的解法是协同的两招:

flowchart TD A[3D 先验注入 Memory 上下文] –> B[多轮视角切换中记住已探索结构] C[Test-Time Training 在线维护] –> D[推理中轻量自适应对齐 3D 约束] B –> E[无漂移·不重置] D –> E

Memory:把场景几何结构、物体位置、空间关系编码成 3D 先验存进上下文,镜头移回来时直接调取,而不是重新猜。 – TTT(测试时训练):推理阶段对当前交互序列做轻量在线微调,让内部表征持续对齐场景的 3D 几何约束。

> 概念注解 · 什么是 Test-Time Training(TTT)? > 传统模型推理时参数冻结。TTT 在”用的时候”继续做一点点训练,针对眼前这条交互序列自适应。代价小、收益大:它让模型面对新物体/新材料(如水、刚体)时,动态更新表征,后续帧更符合该场景的物理。

📏 评测说话

WBench(美团 LongCat + 复旦联合推出,业内首个交互式世界模型系统评测,289 个多轮案例、1058 轮交互、5 维度 22 指标)上:

flowchart LR A[“Navi 分榜 80.9 登顶”] –> B[“物理维度 73.3 第一”] A –> C[一致性 88.0] D[视觉合理性 +13.6%] –> E[因果保真度 +12.7%]

🎮 三方向落地

AI 互动影游:用户从被动观众变成叙事参与者,世界沿分支剧情演进,多重结局。 – 具身智能仿真:生成物理可信的城市/工厂/室内,做机器人与自动驾驶的低成本虚拟试验场。 – 3D 场景生产:一键生成带完整结构的 3D 物件与场景,支持结构微调与风格切换(甚至延伸到细胞行为模拟,服务药物发现)。

📊 一个比喻

flowchart LR A[“传统模型: 画家逐帧作画”] –>|误差累积| B[漂移·物体消失] C[“HiDream: 有空间记忆的导演”] –>|Memory+TTT| D[调取视角·自洽生成]

🔍 一句话判断

世界模型竞赛的拐点不在”画得更美”,而在”记得住、走得通、合乎物理”。HiDream-O1-World 把 Memory 与 TTT 拧成一股绳,在 WBench 物理维度拿了第一——这恰恰是世界模型从 demo 走向仿真基础设施最硬的那块拼图。

📚 参考文献

1. 智象未来(HiDream.ai), HiDream-O1-World 发布(2026-08). 2. 极客公园,《原生全模态路线进阶,智象未来发布交互式世界模型 HiDream-O1-World》(2026-08). 3. 香港商报,同题报道(2026-08-24). 4. DreamWorld: Geometry-Grounded Video Diffusion for 3D-Consistent World Modeling, ECCV 2026. 5. WBench(美团 LongCat + 复旦)交互式世界模型评测基准.

发表回复

人生梦想 - 关注前沿的计算机技术 acejoy.com 🐾 步子哥の博客 🐾 背多分论坛 🐾 借一步网 🐾 智柴网 沪ICP备2024052574号-1