🏛️ 从像素到神殿:AI如何学会从视频中雕刻三维世界
> 论文: WorldSculpt: Generating Compositional Worlds from Grounded Videos > 作者: Muyao Niu, Jixuan He, Ruihan Yu 等 > 领域: 计算机视觉 / 3D生成 / 场景理解 > arXiv: https://arxiv.org/abs/2609.03456 > 发表时间: 2026年9月
—
🎬 第一章:视频中的隐藏世界
想象你正在观看一段视频。
画面中是一个杂乱的厨房台面:一个陶瓷花瓶里插着几支干枯的玫瑰,旁边是一个半满的咖啡杯,杯底有一圈褐色的咖啡渍。一只橘色的猫从画面边缘走过,尾巴扫过一本摊开的杂志。阳光从窗户斜射进来,在木质台面上投下长长的阴影。背景中,你能隐约看到冰箱门上贴着的彩色磁贴和一张褪色的 polaroid 照片。
对于人类来说,这个场景是立体的、可理解的。你知道花瓶是圆柱形的,知道咖啡杯有把手(即使把手被遮挡了),知道猫的尾巴是柔软的、有弹性的。你能在脑海中旋转这些物体,想象从不同角度看到的样子。你能估计距离——花瓶离咖啡杯大约15厘米,猫离台面大约10厘米高。
但对于计算机来说,这段视频只是一堆像素——每秒30帧,每帧几百万个颜色值。它不知道什么是”花瓶”,什么是”猫”。它看不到被遮挡的部分。它不理解物理——不知道重力、不知道物体是实心的还是空心的、不知道陶瓷和木头在质感上的区别。
WorldSculpt 的目标,就是让计算机从这样的视频中,重建出一个完整的、可编辑的、组合式的三维世界。
不是一张平面的深度图。不是一个模糊的体积表示。而是一个真正的三维场景:每个物体都是独立的网格(mesh),有精确的几何形状,可以在三维空间中移动、旋转、删除。花瓶就是花瓶,杯子就是杯子,猫就是猫。它们各自独立,又共享同一个世界坐标系。
—
🏗️ 第二章:为什么这件事难如登天
在深入WorldSculpt的技术细节之前,让我们先理解为什么这个问题如此困难。
2.1 遮挡的诅咒
在杂乱的场景中,物体之间大量相互遮挡。从某个视角看,你只能看到花瓶的正面,背面完全被挡住了。咖啡杯的把手可能只露出了一半。猫的尾巴在扫过杂志时,被杂志的边缘切断了。
人类处理遮挡的方式是推理:我们知道花瓶通常是圆柱形的,所以即使看不到背面,我们也能推断出它的完整形状。我们知道猫尾巴是连续的,所以即使中间有一段被挡住了,我们也知道它在那里。
但AI没有这种”常识”。传统的三维重建方法(如多视角立体视觉)依赖多视角观察:从多个角度拍摄同一个场景,然后通过三角测量计算深度。但在密集杂乱的场景中,每个视角只能看到场景的一小部分。花瓶的背面可能从任何角度都看不到——它被其他物体完全包围了。
2.2 组合爆炸
假设一个场景中有100个物体。每个物体都有自己的形状、姿态、材质、光照响应。传统的重建方法通常将整个场景作为一个整体来处理——生成一个统一的表示(如体素网格或神经辐射场)。
但这种方法有几个问题:
第一,分辨率受限。如果要表示一个包含100个物体的场景,每个物体需要一定的分辨率来呈现细节。整体表示的分辨率必须足够高,以同时捕捉所有物体的细节。这意味着巨大的计算和存储开销。
第二,编辑困难。如果你想移动场景中的一个物体(比如把花瓶移到桌子的另一边),整体表示需要重新计算。因为物体的移动会改变遮挡关系、阴影、反射——这些都会影响整体的表示。
第三,新视角合成质量差。整体表示在训练视角附近表现良好,但在全新的视角(尤其是看到之前被遮挡的区域)时,往往产生模糊或不合理的结果。
组合式表示(compositional representation)——将场景表示为独立物体的集合——解决了这些问题。但它引入了新的挑战:如何知道哪里有一个物体?如何分割物体和背景?如何处理物体之间的边界?
2.3 生成vs重建
传统的方法是重建(reconstruction):从观测数据中恢复场景的三维结构。重建是确定性的——给定相同的输入,总是产生相同的输出。
但重建有一个根本性的限制:你无法重建你没有看到的东西。如果花瓶的背面从未出现在任何视角中,重建方法就无法知道它的背面是什么样子的。它可能生成一个平整的切面,或者一个随机的凹凸——但都不是真实的背面。
WorldSculpt采用了一种不同的思路:生成(generation)。它不仅从视频中重建看到的部分,还利用生成先验(generative prior)来想象看不到的部分。
生成先验是什么?它是一个在大规模三维数据上训练的神经网络,学会了”典型的物体长什么样”。比如,它知道花瓶通常是圆柱形的,知道杯子通常有把手,知道猫的尾巴是锥形的。当它遇到遮挡时,它会根据这个先验来”填补空白”。
这就像是:一位法医艺术家根据目击者的描述和头骨结构,重建出死者的面部。她没有看到过死者的真实面容,但她根据人类面部的统计规律,做出了合理的推断。WorldSculpt做的也是类似的事情——根据”典型物体的统计规律”,推断出被遮挡部分的几何形状。
—
🎨 第三章:Pixal3D——单物体的雕塑家
WorldSculpt的核心是一个叫做 Pixal3D 的模型。要理解WorldSculpt,我们必须先理解Pixal3D。
3.1 从单视图到三维网格
Pixal3D是一个单视图三维重建模型。给定一张物体的图片,它可以生成该物体的完整三维网格。
这本身就是一个极具挑战性的问题。从单张图片重建三维形状是欠定的(underdetermined)——一张二维图片包含的信息不足以唯一确定三维形状。比如,一张圆形的图片可能是一个球、一个圆柱、一个圆盘,或者一个圆锥的底面。
Pixal3D解决这个问题的关键,就是生成先验。它在一个大规模的三维数据集上训练(如ShapeNet、Objaverse),学会了各种物体的典型三维形状。当遇到一张新图片时,它从学到的形状分布中”采样”一个最匹配的三维形状。
这就像是:你看到一个陌生人的侧脸照片,需要画出他的正面。你从未见过他的正面,但根据你对人类面部的了解——眼睛在鼻子上方,嘴巴在鼻子下方,耳朵在头部两侧——你可以做出合理的推断。Pixal3D做的就是这个,但它处理的是所有类型的物体,而不仅仅是人脸。
3.2 神经辐射场与网格的桥梁
Pixal3D的另一个关键特性是:它生成的是显式的三维网格(explicit mesh),而不是隐式的神经辐射场(NeRF)或隐式表面表示。
为什么要显式网格?因为下游应用需要它。游戏引擎使用网格来渲染物体。AR/VR应用需要网格来进行物理碰撞检测。机器人需要网格来规划抓取路径。神经辐射场虽然能生成漂亮的图像,但它是一个”黑箱”——你不能直接编辑它、不能提取物体的边界、不能计算物理属性。
但生成高质量的网格比生成神经辐射场更难。网格需要明确的拓扑结构——顶点如何连接成边,边如何连接成面。这种离散的结构难以用神经网络直接生成(神经网络擅长生成连续的数值,不擅长生成离散的图结构)。
Pixal3D通过一个巧妙的两阶段方法来解决这个问题: 1. 第一阶段:生成一个粗糙的体素网格(voxel grid),表示物体的粗略形状 2. 第二阶段:将体素网格转换为三角网格(triangle mesh),并通过可微分渲染进行细化
这种方法结合了两者的优点:体素表示易于生成,三角网格适用于下游应用。
—
🌍 第四章:从单物体到整个世界——WorldSculpt的魔法
现在我们有了一件强大的工具:Pixal3D可以从单张图片重建单个物体的三维网格。但WorldSculpt的目标是整个场景——包含数百个物体的复杂世界。
4.1 多视角条件化
WorldSculpt的核心创新是多视角条件化(multi-view conditioning)。
在传统的单视图重建中,模型只看到一张图片。但在视频中,我们有多帧,每帧都是从稍微不同的视角拍摄的(即使摄像机静止,物体的运动也会提供额外的视角信息)。
WorldSculpt扩展了Pixal3D,增加了一个多视角条件化路径(multi-view conditioning pathway)。这个路径接收多个视角的观测,并将它们融合到一个统一的特征空间中。
具体来说,对于场景中的每个物体,WorldSculpt会: 1. 检测物体:在视频帧中识别出不同的物体(使用现成的分割模型,如SAM) 2. 提取多视角特征:对每个物体,从所有能看到它的视角中提取视觉特征 3. 融合特征:将这些多视角特征融合成一个统一的物体表征 4. 生成网格:使用Pixal3D生成物体的三维网格 5. 放置到世界坐标系:根据多视角几何,确定物体在共享世界坐标系中的位置
4.2 组合式生成——每个物体独立,又共享世界
WorldSculpt的关键设计决策是组合式(compositional):场景中的每个物体都是独立生成的,然后被放置到一个共享的世界坐标系中。
这听起来简单,但实现起来有很多挑战:
挑战一:一致性
如果每个物体是独立生成的,如何确保它们在几何和外观上相互一致?比如,一个花瓶放在桌子上,花瓶的底部应该与桌面接触,而不是悬浮在空中或穿透桌面。
WorldSculpt通过世界坐标系中的碰撞检测和物理约束来解决这个问题。在放置每个物体后,系统会检查它是否与其他物体重叠。如果重叠,会调整物体的位置或姿态,直到满足物理约束。
挑战二:遮挡推理
在多视角观测中,物体A可能遮挡物体B。在生成物体B时,模型需要知道”物体A的存在”,以避免生成穿透物体A的几何。
WorldSculpt通过按深度顺序生成来解决这个问题。它首先生成最前面的物体(从摄像机视角看),然后逐步向后生成。在生成后面的物体时,前面的物体已经被固定,因此可以作为遮挡约束。
挑战三:光照一致性
不同的物体可能受到相同的光照条件影响。如果每个物体独立生成,它们的光照可能不一致——一个物体可能有强烈的阴影,而相邻的物体却没有。
WorldSculpt通过共享光照估计来解决这个问题。它首先从视频帧中估计全局光照(光源方向、强度、环境光),然后在生成每个物体时应用相同的光照条件。
4.3 从单物体训练到复杂场景的零样本泛化
最令人惊讶的发现是:WorldSculpt的模型(基于Pixal3D)完全在单物体数据上训练,但它能够泛化到包含数百个物体的复杂场景,而没有任何场景级别的训练。
这怎么可能?
关键在于组合性(compositionality)。WorldSculpt学到的不是”场景长什么样”,而是”物体会长什么样”。它学会了花瓶的通用形状、杯子的通用形状、猫的通用形状。然后,在测试时,它只需将这些学到的物体形状”组装”到场景中。
这就像是:一个乐高积木设计师设计了一套标准积木——方块、长条、轮子、窗户。他没有设计具体的模型(如城堡或飞船),但这些积木可以组合成无限多种模型。WorldSculpt的生成先验就像是这些标准积木——它提供了基本的”建筑单元”,然后在测试时根据视频的具体内容来组装它们。
这种组合式的方法不仅使泛化成为可能,还使系统具有可扩展性。添加新的物体类型只需要训练该物体的单视图重建模型,而不需要重新训练整个场景生成系统。
—
📊 第五章:UE-MeshyScene——一个残酷的基准测试
为了验证WorldSculpt的能力,作者们创建了一个全新的基准测试:UE-MeshyScene。
5.1 为什么需要新基准
现有的三维场景数据集(如ScanNet、Matterport3D)有几个问题:
第一,物体数量少。大多数真实场景的扫描只包含十几个到几十个物体。WorldSculpt的目标是有数百个物体的密集杂乱场景,现有数据集无法覆盖这个范围。
第二,缺乏真实标注。真实场景的扫描数据通常只有整体的三维表示,没有每个物体的独立网格和精确姿态。这使得定量评估变得困难——你无法直接比较生成的物体网格与真实网格,因为没有”真实网格”。
第三,领域差距。真实场景的扫描数据有噪声、不完整、光照变化大。在这些数据上训练或评估,难以区分方法的优劣——是方法不好,还是数据质量差?
5.2 UE-MeshyScene的设计
UE-MeshyScene使用虚幻引擎(Unreal Engine)来生成逼真的合成场景。这样做的好处是:
完全控制:可以精确控制场景中的物体数量、类型、布局、光照、摄像机参数 真实标注:每个物体都有精确的网格、纹理、姿态——因为它们是直接放在场景中的 可扩展性:可以轻松生成数千个不同的场景,而不需要人工扫描
UE-MeshyScene包含: – 数百个物体的密集杂乱场景 – 每个物体的精确标注:网格、姿态、类别 – 多样化的场景类型:厨房、客厅、办公室、仓库 – 多种摄像机轨迹:静态、环绕、手持摇晃 – 真实感渲染:光线追踪、全局光照、材质反射
5.3 评估结果
WorldSculpt在UE-MeshyScene上的表现令人印象深刻:
单物体重建质量:与最先进的单视图重建方法相比,WorldSculpt在多视角条件下显著提高了重建精度。特别是在遮挡区域(从任何视角都看不到的部分),生成先验有效地填补了缺失的几何。
多物体场景重建:在包含多个物体的场景中,WorldSculpt能够准确分离不同的物体,并为每个物体生成合理的网格。与将场景作为整体重建的方法相比,WorldSculpt在物体边界处表现更好——整体方法往往产生粘连的几何(两个物体的边界模糊),而WorldSculpt的组合式方法保持物体的独立性。
跨域泛化:在从真实视频(而非合成数据)重建的实验中,WorldSculpt展示了良好的泛化能力。尽管在合成数据上训练,它能够处理真实世界的复杂性——光照变化、运动模糊、镜头畸变。
大规模场景:在包含数百个物体的场景中,WorldSculpt的可扩展性得到了验证。生成时间随物体数量线性增长(而不是指数增长),这使得它适用于大规模场景。
—
🌐 第六章:应用前景——从游戏到机器人
WorldSculpt的技术不仅具有学术价值,还有广泛的实际应用前景。
6.1 游戏开发
在现代游戏开发中,创建三维场景是一个耗时且昂贵的过程。艺术家们需要手工建模每个物体、调整材质、设置光照、布置场景。一个大型开放世界游戏可能有数万个独特的场景,每个场景都需要数十到数百小时的艺术家工作。
WorldSculpt提供了一种全新的工作流: 1. 艺术家使用手机拍摄真实场景的视频(或从网上找到参考视频) 2. WorldSculpt自动生成三维场景的可编辑表示 3. 艺术家在生成的场景基础上进行修改和润色 4. 导出到游戏引擎(如Unity、Unreal Engine)
这种工作流可以将场景创建的时间从数天缩短到数小时。更重要的是,它降低了三维内容创作的门槛——非专业的创作者也可以从视频中快速生成可编辑的三维场景。
6.2 AR/VR
在增强现实和虚拟现实中,将虚拟物体与现实世界融合是一个核心问题。传统的方法需要精确的三维扫描和手动对齐,过程繁琐且容易出错。
WorldSculpt可以简化这个流程: 1. 用AR眼镜拍摄现实环境的视频 2. WorldSculpt自动生成环境的三维表示 3. 虚拟物体可以自动与现实物体交互(如放在桌子上、藏在沙发后面)
这种实时三维理解能力是AR/VR走向大众市场的关键技术之一。
6.3 机器人学
在机器人学中,场景理解是导航、抓取、人机交互的基础。机器人需要知道场景中有哪些物体、它们在哪里、如何与它们交互。
WorldSculpt生成的组合式三维表示特别适合机器人学应用: – 碰撞检测:每个物体都有明确的网格,可以进行精确的碰撞检测 – 抓取规划:知道物体的完整几何形状,可以规划稳定的抓取姿态 – 任务规划:物体是独立可识别的,可以针对特定物体规划任务(如”拿起红色的杯子”)
6.4 数字孪生
在工业应用中,数字孪生(digital twin)——物理世界的精确虚拟副本——正在变得越来越重要。WorldSculpt可以从工厂、仓库、办公室的视频中自动生成数字孪生,用于监控、仿真和优化。
—
🔮 第七章:未来展望——从重建到创造
WorldSculpt代表了三维计算机视觉领域的一个重要趋势:从重建走向创造。
7.1 重建的局限
传统的三维重建是”被动”的——它试图从观测数据中恢复真实的三维结构。这种方法的根本限制是:它无法创造观测中没有的信息。
但人类视觉不是这样工作的。当我们看到一个被遮挡的物体时,我们不仅在”重建”看到的部分,还在”想象”被遮挡的部分。这种想象基于我们对物体类别的先验知识——我们知道花瓶通常是圆柱形的,知道椅子通常有四条腿。
WorldSculpt将这种”想象”能力引入了计算三维视觉。它不是在被动地重建,而是在主动地创造——基于观测和先验,创造一个完整的三维世界。
7.2 生成式三维视觉
近年来,生成式AI在二维图像领域取得了巨大成功(如DALL-E、Midjourney、Stable Diffusion)。但在三维领域,生成式方法仍处于早期阶段。
WorldSculpt是生成式三维视觉的重要一步。它展示了如何将生成先验(来自大规模三维数据集)与观测数据(来自视频)结合,创造出既符合观测、又符合先验的三维场景。
未来的发展方向可能包括: – 文本到三维场景:输入”一个杂乱的青少年卧室,墙上贴着摇滚乐队海报”,直接生成三维场景 – 交互式编辑:在生成的场景中,通过自然语言指令进行编辑(如”把花瓶换成蓝色的”、”在桌子上加一本书”) – 物理仿真:生成的场景不仅有几何,还有物理属性——质量、摩擦系数、弹性——可以进行真实的物理仿真 – 动态场景:不仅生成静态场景,还生成动态场景——物体可以移动、碰撞、破碎
7.3 走向通用三维智能
最终,WorldSculpt的技术路线可能通向一个更宏大的目标:通用三维智能(General 3D Intelligence)。
就像GPT-4展示了通用语言智能的可能性——一个模型可以处理各种语言任务——未来的三维AI模型可能能够处理各种三维任务:重建、生成、编辑、仿真、理解、推理。
WorldSculpt是这条道路上的一个里程碑。它证明了,通过组合式生成先验和多视角条件化,我们可以从视频中创造出可编辑的三维世界。这只是开始——更通用、更强大、更智能的三维AI系统正在路上。
—
🎪 尾声:像素背后的世界
让我用一个场景来结束这篇解读。
想象未来的某一天,你走进一个房间,戴上一副轻便的AR眼镜。你环视四周——书架、沙发、茶几、窗台上的盆栽。眼镜的摄像头默默记录着一切。
几秒钟后,你的眼前浮现出一个半透明的三维网格,覆盖在真实世界之上。你可以看到书架的每一本书的轮廓,虽然书脊上的文字还不够清晰。你可以看到沙发的内部结构——弹簧、填充物、框架。你可以伸手”触碰”窗台上的盆栽,看到它的根系在土壤中的分布。
这不是魔法。这是WorldSculpt及其后继技术的日常应用。
我们从像素出发——那些看似毫无意义的红绿蓝数值。通过AI的眼睛,我们看见了形状、深度、材质、光照。通过生成先验的想象力,我们填补了遮挡、恢复了缺失、创造了完整。
最终,我们得到的不仅是一个三维模型,而是一个可理解的世界——一个我们可以编辑、可以交互、可以创造的世界。
正如费曼所说:”自然界只用最长的线来编织她的图案。”从视频到三维世界,AI正在学会编织这些最长的线——从二维的观测中,推断出三维的现实。
—
📚 参考文献
[1] Niu, M., He, J., Yu, R., et al. “WorldSculpt: Generating Compositional Worlds from Grounded Videos.” arXiv preprint arXiv:2609.03456, 2026.
[2] Mildenhall, B., Srinivasan, P. P., Tancik, M., et al. “NeRF: Representing Scenes as Neural Radiance Fields for View Synthesis.” ECCV, 2020.
[3] Kirillov, A., Mintun, E., Ravi, N., et al. “Segment Anything.” ICCV, 2023.
[4] Deitke, M., Schwenk, D., Salvador, J., et al. “Objaverse: A Universe of Annotated 3D Objects.” CVPR, 2023.
[5] Chang, A. X., Funkhouser, T., Guibas, L., et al. “ShapeNet: An Information-Rich 3D Model Repository.” arXiv preprint arXiv:1512.03012, 2015.
[6] Dai, A., Chang, A. X., Savva, M., et al. “ScanNet: Richly-Annotated 3D Reconstructions of Indoor Scenes.” CVPR, 2017.
[7] Rombach, R., Blattmann, A., Lorenz, D., et al. “High-Resolution Image Synthesis with Latent Diffusion Models.” CVPR, 2022.
[8] Nichol, A., Jun, H., Dhariwal, P., et al. “Point-E: A System for Generating 3D Point Clouds from Complex Prompts.” arXiv preprint arXiv:2212.08751, 2022.
—
解读完成于 2026年9月8日 费曼风格深度解读 | 小凯
#论文解读 #WorldSculpt #三维重建 #场景生成 #组合式生成 #多视角条件化 #计算机视觉 #AI #小凯
