高斯溅射与视频生成:显式表示驱动的汇流
一、引言:两股潮流为何汇流
夫视频生成者,历来以「像素网格时序」为基,扩散模型擅造外观之连续,而苦于多视角与时间之不一致——盖其所生,每帧皆「似真」,未必同属一世界。另一边,3DGS 以数百万可学习高斯原语(位置 μ、协方差 Σ、不透明度 α、球谐 SH)承载场景,可微光栅化令其秒级训练、数百 FPS 渲染(Kerbl et al., 2023)。
二者之汇流,实因一共同痛点:一致性。视频生成缺几何约束而漂,3DGS 缺生成先验而匮于未见之域。故近三年(2023–2026)研究,渐由「各擅其场」走向「以 GS 为画布、以扩散为笔」之合流。此即本综述之「和」字本意。
二、技术基座:3D Gaussian Splatting 是什么
3DGS 之核心,在以显式、可微、可编辑之高斯原语替 NeRF 之隐式体场。每原语参数为:位置 μ∈ℝ³、各向异性协方差 Σ=R S Sᵀ Rᵀ(旋转 R、缩放 S)、不透明度 α、视角相关色彩(球谐 SH)。渲染时投影为 2D 椭圆「splat」,按深度排序 alpha 混合并反传。
其优有三:一训速以分钟计(NeRF 以时计),二渲速达 100–300 FPS,三原语显式,便于剪枝、编辑、稠密化。然其弊亦萌于此:原语数随场景复杂度线性膨胀,存储与显存俱受其累;且静态框架本不言「时间」。
三、第一汇流点:动态与 4D 表示(重建维度)
将时间引入 3DGS,谓之 4D Gaussian Splatting。主流范式有二:逐帧迭代与形变场(deformation field)。
| 方法 | 发表 | 机制 | 关键数字 | 局限 |
|---|---|---|---|---|
| 4D-GS(Wu et al.) | CVPR 2024 | 时空结构编码 + MLP 形变解码 | 高保真动态重建 | 依赖稠密多视角 |
| Deformable 3D Gaussians(Yang et al.) | CVPR 2024 | canonical + 形变 MLP 查 4D 坐标 | 单目动态人体 | 剧烈非刚性形变弱 |
| Gaussian-Flow(Lin et al.) | CVPR 2024 Highlight | 双域形变 DDDM:时域多项式 + 频域傅里叶 | 训练较逐帧快 5×,~125 FPS | 长程剧烈运动受限 |
| Scaffold-GS(Lu et al.) | CVPR 2024 | 锚点 anchor + 神经高斯,视图自适应 | 减冗余、提质量 | 动态扩展有限 |
| MoDec-GS / MoSca / OriGS / ODE-GS / EvoGS | CVPR/NeurIPS 2025 | 运动分解、4D 脚手架、ODE 连续动力学 | 时序外推、样本高效 | 各擅一场,未归一 |
Devil’s Advocate 一击:上表所列,胜在「已被观测之域」。一旦遮挡、拓扑突变、视角外推,纯光度优化之形变场即现结构漂移(Ground4D 实证,见后)。此非枝节,乃 dynamic GS 之根本软肋。
四、第二汇流点:生成式 4D(创造维度)
重建只能「复现所拍」,生成方能「凭空造物」。4D 生成之难,不在多一维时间,而在几何、外观、运动、跨视角四项须同时稳。Miao 等(2025)之综述将范式析为四类:
- 端到端:直接学 4D 分布(理想终局,唯赖大数据);
- 生成中间数据:先造多视角/多时视频,再喂入既有 4D 重建管线(任务分解之智);
- 隐式蒸馏(SDS):以扩散为裁判,反复渲染—问差—反传,雕 4D 表示(灵活而贵);
- 显式监督:直接以参考视频/多视图/几何监督,效高可控(前层数据须可靠)。
Text/Image → 4D:DreamGaussian(Tang et al., ICLR 2024)以 2 分钟成 3D、约 10× 加速,开「GS + 生成」之先河;GaussianDreamer(Yi et al., 2023)桥接 2D 与 3D 扩散,造可操控高斯物体。
Video → 4D(2026 年之锋锐):
- GenMOJO(Chu et al., CMU+TRI, 2025):多物体遮挡场景之 video-to-4D;
- Ground4D(Zhao et al., 中山+清华, 2026, arXiv:2606.28828):以 3D 基础模型 VGGT 做训练免几何初始化,再以动态 GS 精炼,DyCheck 上 mPSNR 19.43 dB、Chamfer 0.226,正揭「纯光度优化致结构漂移」之病;
- World from Motion / WfM(Zhu et al., 斯坦福+NVIDIA, 2026, arXiv:2607.01202):闭环最巧——初重建动态 3DGS → 渲染 RGB/Depth/Normal/3D Scene Flow 为 4D buffer → 条件化视频生成模型造「虚拟多视角」→ 深度反投影、增新高斯、重优 motion,写回单一一致 4DGS。DyCheck 19.78 mPSNR、MultiCamVideo 27.43 PSNR,俱为 SOTA。
五、第三汇流点:GS 作视频与世界模型表示
- GaussianVideo(Bond et al., Koc+Adobe, ICCV 2025, arXiv:2501.04782):层次化 GS + Neural ODE 学连续相机运动 + B-样条运动 + 时空层次学习。不依赖预计算相机参,内存省、时序一致强;令高斯运动自然涌现语义连贯,非强监督光学流所迫。
- WorldWarp(Kong et al., 新国大+理大, 2025, arXiv:2512.19678):以在线 3DGS 几何缓存为结构锚,以时空扩散 ST-Diff 为生成精炼;时变噪声调度——空白区满噪以生、扭曲区半噪以修,chunk-by-chunk 生成 200 帧长程几何一致视频。诀:3D 逻辑导结构,扩散逻辑完美纹理。
- D2GV(Liu et al., 交大+UMKC, 2025, arXiv:2503.05600):可变形 2D GS 表视频,GoP 并行、CUDA 光栅化,解码超 400 FPS,质量匹敌乃至超 INR,兼擅插帧/修复/去噪。
六、效率与压缩:让实时成为现实
显式表示之代价,在膨胀。三文为压缩立柱:LightGaussian(Fan et al., NeurIPS 2024 Spotlight, arXiv:2311.17245)15× 压缩、200+ FPS;3DGS.zip(Bagdasarian et al., CGF 2025)统九类模块之压缩综述;Splatwizard(Liu et al., 2025, arXiv:2512.24742)3DGS 压缩 Benchmark 工具包,使压缩可度量。
Devil’s Advocate 二击:压缩常以画质/编辑性为价。15× 之后,原语之「可编辑」优势是否尚存?此须以任务定夺,不可一概而论。
七、正反 PK:GS 真能推动视频生成飞跃否?
正方 · 技术乐观
- 显式即可控:每原语可读、可编辑、可绑定骨架,优于 NeRF 黑箱与视频像素;
- 实时即落地:百 FPS 渲染,使交互世界、数字人、自驾仿真可得;
- 可组合即系统:GS 作画布,扩散、物理、轨迹皆可叠加(WfM、WorldWarp 为证);
- 数据高效:以强模态先验雕弱模态,避端到端大数据之困。
反方 · 局限批判
- 存储/显存膨胀:原语数随复杂度线性涨,长程场景不堪;
- 拓扑难塑:拓扑突变、非刚大形变、烟雾毛发,变形场乏力(TagSplat, CVPR’26 直言开放);
- 物理与时间一致性薄弱:纯光度优化致结构漂移、长程时序漂移(Ground4D、WfM 共证);
- 多视角先验不一致:扩散「每帧似真、合之非一世界」,须几何回投约束;
- 透明/反射材质弱:逊于体渲染之 NeRF;锯齿闪烁犹在。
八、技术路线图与对比矩阵
| 方法 | 发表 | 类型 | 核心机制 | 速度/指标 | 一句话定位 |
|---|---|---|---|---|---|
| 3DGS | SIGGRAPH’23 | 静态表示 | 显式高斯 + 可微光栅化 | 100–300 FPS | 实时表示之基 |
| 4D-GS | CVPR’24 | 4D 重建 | 时空编码 + MLP 形变 | 高保真 | 动态入门 |
| Deformable 3D GS | CVPR’24 | 4D 重建 | canonical + 形变场 | 单目人体 | 形变场范式 |
| Gaussian-Flow | CVPR’24 HL | 4D 重建 | DDDM 双域形变 | ~125 FPS, 5×快 | 高效动态 |
| Scaffold-GS | CVPR’24 | 静/动 | anchor + 神经高斯 | 减冗余 | 视图自适应 |
| DreamGaussian | ICLR’24 | 生成 4D | GS + 扩散 | 2 分钟成 3D | 生成先河 |
| GaussianDreamer | 2023 | 生成 4D | 桥接 2D/3D 扩散 | 可操控 | text→4D |
| GenMOJO | 2025 | video→4D | 多物体遮挡重建 | DAVIS/MOSE | 遮挡场景 |
| Ground4D | 2026 | video→4D | VGGT 初始化 + GS 精炼 | mPSNR 19.43 | 几何一致性 |
| World from Motion | 2026 | video→4D | 虚拟观测蒸馏回 3DGS | DyCheck 19.78 | 闭环 SOTA |
| GaussianVideo | ICCV’25 | 视频表示 | 层次 GS + Neural ODE | 高/低动俱优 | 世界模型雏形 |
| WorldWarp | 2025 | 世界模型 | 在线 3DGS 缓存 + ST-Diff | 200 帧 | 长程一致 |
| D2GV | 2025 | 视频表示 | 可变形 2D GS | >400 FPS | 极速解码 |
| LightGaussian | NeurIPS’24 | 压缩 | 剪枝+蒸馏+哈希 | 15×, 200+ FPS | 压缩标杆 |
九、挑战与 Benchmark
- 拓扑与一致性:拓扑一致动态网格(TagSplat, CVPR’26)、跨视角/长程时序漂移,仍为开放题;
- 物理合理性:PhysTwin(ICCV’25)等倡物理信息重建,然「动得像真」未普适;
- Benchmark 缺口:4D 评测多沿用 PSNR/SSIM/LPIPS/FVD/CLIP,抓不住「跨视角一致、长程漂移、几何-外观错配」之真败因(Miao et al., 2025 之警);
- 统一框架:今之系统仍「图像扩散管外观、视频扩散管动、多视图管视角」,一致性多留后处理扛;
- 数据:大规模、多条件、多动态类型之 4D 数据稀缺,端到端 foundation model 难立。
常用指标:PSNR、SSIM、LPIPS、FPS、显存占用、Chamfer Distance、mPSNR(DyCheck)、PCK@0.05(3D track)。
十、结论与展望
3DGS 与视频生成之汇流,非偶合,而因「一致性」这一共同焦虑。三年之间,已由静态表示(Kerbl’23)→ 动态 4D(CVPR’24 诸作)→ 生成式 4D(2025–26 之 WfM、Ground4D)→ 视频/世界模型画布(GaussianVideo、WorldWarp、D2GV),并以压缩(LightGaussian 等)谋落地。
拍板之见:短期以条件化混合表示为实用之锚——几何立骨、扩散补 flesh、物理/深度回填;长期则向统一 4D 生成框架与大规模多条件数据挺进。凡涉交互式世界、数字人、自驾仿真、具身智能者,GS 与视频生成之合流,方其始也。
参考文献
Bagdasarian, M., et al. (2025). 3DGS.zip: A survey of 3D Gaussian Splatting compression. Computer Graphics Forum.
Bond, A., Wang, J.-H., Mai, L., Erdem, E., & Erdem, A. (2025). GaussianVideo: Efficient video representation via hierarchical Gaussian splatting. In ICCV. arXiv:2501.04782
Chu, et al. (2025). GenMOJO: Generating multi-object 4D scenes from monocular video. arXiv:2506.12716
Fan, Z., et al. (2024). LightGaussian: Unbounded 3D Gaussian compression with 15× reduction and 200+ FPS. In NeurIPS. arXiv:2311.17245
Guo, H., Weng, D., Su, M., et al. (2026). TagSplat: Topology-aware Gaussian splatting for dynamic mesh modeling and tracking. In CVPR. arXiv:2512.01329
Kerbl, B., Kopanas, G., Leimkühler, B., & Drettakis, G. (2023). 3D Gaussian Splatting for real-time radiance field rendering. ACM TOG, 42(4), 139. arXiv:2308.04079
Kong, H., Yang, X., Zheng, X., & Wang, X. (2025). WorldWarp: Propagating 3D geometry with asynchronous video diffusion. arXiv:2512.19678
Lin, Y., Dai, Z., Zhu, S., & Yao, Y. (2024). Gaussian-Flow: 4D reconstruction with dynamic 3D Gaussian particle. In CVPR (pp. 21136–21145). arXiv:2312.03431
Liu, M., Yang, Q., Zhao, M., Huang, H., Yang, L., Li, Z., & Xu, Y. (2025). D2GV: Deformable 2D Gaussian splatting for video representation in 400FPS. arXiv:2503.05600
Liu, et al. (2025). Splatwizard: A toolkit for benchmarking 3D Gaussian splatting compression. arXiv:2512.24742
Lu, T., et al. (2024). Scaffold-GS: Structured 3D Gaussians for view-adaptive rendering. In CVPR. arXiv:2312.00109
Miao, Q., Li, K., Quan, J., et al. (2025). Advances in 4D generation: A survey. arXiv:2503.14501
Tang, J., et al. (2024). DreamGaussian: Generative Gaussian splatting for efficient 3D content creation. In ICLR. arXiv:2309.16653
Wu, G., Yi, T., Fang, J., et al. (2024). 4D Gaussian Splatting for real-time dynamic scene rendering. In CVPR. arXiv:2310.08528
Yang, Z., Gao, X., Zhou, W., Jiao, S., Zhang, Y., & Jin, X. (2024). Deformable 3D Gaussians for animatable humans from monocular videos. In CVPR. arXiv:2309.13101
Yi, T., et al. (2023). GaussianDreamer: Text to manipulable 3D Gaussian objects with generated multi-view images. arXiv:2310.03585
Zhao, M., et al. (2025). Advances in 4D representation: Geometry, motion and interaction. In ICLR. (4DRep-GMI)
Zhao, Q., Deng, W., Wei, P., & Lin, L. (2026). Ground4D: Consistency-aware 4D reconstruction from monocular video. arXiv:2606.28828
Zhu, L., Huang, S., Mazumdar, A., Li, T., Gojcic, Z., Wetzstein, G., Armeni, I., De Mello, S., & Trevithick, A. (2026). World from Motion: Generative dynamic Gaussian reconstruction from monocular video. arXiv:2607.01202
