高斯溅射与视频生成:显式表示驱动的汇流

高斯溅射与视频生成 · 交叉全景综述 :root{ --bg:#0f1115; --panel:#171a21...

高斯溅射与视频生成 · 交叉全景综述 :root{ –bg:#0f1115; –panel:#171a21; –panel2:#1d212b; –ink:#e7e9ee; –mut:#9aa3b2; –line:#2a2f3a; –acc:#7cc4ff; –acc2:#ffd479; –grn:#7ee0a8; –red:#ff8a8a; –pur:#c9a7ff; } *{box-sizing:border-box} body{margin:0;background:var(–bg);color:var(–ink); font-family:”Noto Serif SC”,”Songti SC”,Georgia,”Times New Roman”,serif; line-height:1.85;font-size:17px;} .wrap{max-width:940px;margin:0 auto;padding:48px 28px 80px;} h1{font-size:30px;line-height:1.35;margin:0 0 6px;letter-spacing:.5px} h2{font-size:22px;margin:42px 0 14px;padding-left:12px;border-left:4px solid var(–acc); color:#fff;} h3{font-size:18px;margin:26px 0 8px;color:var(–acc2)} .sub{color:var(–mut);font-size:14px;margin-bottom:8px;font-family:”PingFang SC”,sans-serif} .meta{color:var(–mut);font-size:13px;background:var(–panel);border:1px solid var(–line); border-radius:10px;padding:14px 18px;margin:18px 0;font-family:”PingFang SC”,sans-serif} .abs{background:linear-gradient(180deg,var(–panel2),var(–panel));border:1px solid var(–line); border-radius:12px;padding:20px 24px;margin:18px 0} .abs b{color:var(–acc)} p{margin:14px 0} .tag{display:inline-block;background:var(–panel2);border:1px solid var(–line); border-radius:6px;padding:1px 9px;font-size:13px;color:var(–acc); font-family:”PingFang SC”,sans-serif} table{width:100%;border-collapse:collapse;margin:18px 0;font-size:14px; font-family:”PingFang SC”,sans-serif} th,td{border:1px solid var(–line);padding:9px 11px;text-align:left;vertical-align:top} th{background:var(–panel2);color:#fff;font-weight:600} tr:nth-child(even) td{background:rgba(255,255,255,.02)} code{background:var(–panel2);border:1px solid var(–line);border-radius:5px; padding:1px 6px;font-family:”SFMono-Regular”,Consolas,monospace;font-size:13.5px;color:var(–acc2)} .roadmap{background:var(–panel);border:1px solid var(–line);border-radius:12px; padding:18px;margin:22px 0;text-align:center} .roadmap svg{width:100%;height:auto;max-width:760px} .pk{display:grid;grid-template-columns:1fr 1fr;gap:16px;margin:18px 0} @media(max-width:680px){.pk{grid-template-columns:1fr}} .card{border-radius:12px;padding:16px 18px;border:1px solid var(–line)} .card.p{background:rgba(126,224,168,.07);border-color:rgba(126,224,168,.35)} .card.n{background:rgba(255,138,138,.07);border-color:rgba(255,138,138,.35)} .card h3{margin-top:0} .verdict{background:rgba(124,196,255,.08);border:1px solid rgba(124,196,255,.4); border-radius:12px;padding:16px 20px;margin:20px 0} .verdict b{color:var(–acc)} .da{color:var(–pur);font-weight:600;font-family:”PingFang SC”,sans-serif;font-size:14px} ol,ul{margin:12px 0;padding-left:24px} li{margin:6px 0} .ref{font-size:13.5px;font-family:”PingFang SC”,sans-serif;color:var(–mut);line-height:1.7} .tier{font-size:13px;color:var(–mut);font-family:”PingFang SC”,sans-serif; background:var(–panel);border:1px dashed var(–line);border-radius:10px;padding:12px 16px;margin:20px 0} footer{margin-top:40px;color:var(–mut);font-size:12.5px;font-family:”PingFang SC”,sans-serif; border-top:1px solid var(–line);padding-top:16px}
深度研究 · 交叉全景综述(Deep Research, Cross-cutting Survey)

高斯溅射与视频生成:显式表示驱动的汇流

3D Gaussian Splatting 与视频生成之交叉全景综述 | 体例 APA 7.0 | 成稿 2026-08-25
源流分级(deep-research 铁律):Tier 1 同行评审 3DGS / 4D-GS / Deformable GS / Gaussian-Flow / Scaffold-GS / DreamGaussian / LightGaussian / GaussianVideo / TagSplat Tier 2 预印本 WorldWarp / D2GV / GenMOJO / Ground4D / World from Motion / GaussianDreamer / 4D 生成综述 / 4DRep-GMI / Splatwizard / 3DGS.zip。凡引皆经 WebSearch 核验编号、出处、数字。
摘要。三维高斯溅射(3DGS)以「显式原语 + 可微光栅化」将 NeRF 推入实时之境。然其本为静态表示,何以与视频生成交汇?本文循交叉全景方略,辨其汇流为三:一曰动态与 4D 表示(重建维度),二曰生成式 4D(扩散先验雕形),三曰GS 作视频与世界模型之画布。复以正反两造 PK,论其「显式/实时/可编辑」之长与「存储膨胀/拓扑难塑/物理与时间一致性薄弱」之短,终拍板曰:当下最优解,在条件化、混合表示——以几何为骨,以扩散为 flesh。

一、引言:两股潮流为何汇流

夫视频生成者,历来以「像素网格时序」为基,扩散模型擅造外观之连续,而苦于多视角与时间之不一致——盖其所生,每帧皆「似真」,未必同属一世界。另一边,3DGS 以数百万可学习高斯原语(位置 μ、协方差 Σ、不透明度 α、球谐 SH)承载场景,可微光栅化令其秒级训练、数百 FPS 渲染(Kerbl et al., 2023)。

二者之汇流,实因一共同痛点:一致性。视频生成缺几何约束而漂,3DGS 缺生成先验而匮于未见之域。故近三年(2023–2026)研究,渐由「各擅其场」走向「以 GS 为画布、以扩散为笔」之合流。此即本综述之「和」字本意。

二、技术基座:3D Gaussian Splatting 是什么

3DGS 之核心,在以显式、可微、可编辑之高斯原语替 NeRF 之隐式体场。每原语参数为:位置 μ∈ℝ³、各向异性协方差 Σ=R S Sᵀ Rᵀ(旋转 R、缩放 S)、不透明度 α、视角相关色彩(球谐 SH)。渲染时投影为 2D 椭圆「splat」,按深度排序 alpha 混合并反传。

其优有三:一训速以分钟计(NeRF 以时计),二渲速达 100–300 FPS,三原语显式,便于剪枝、编辑、稠密化。然其弊亦萌于此:原语数随场景复杂度线性膨胀,存储与显存俱受其累;且静态框架本不言「时间」。

三、第一汇流点:动态与 4D 表示(重建维度)

将时间引入 3DGS,谓之 4D Gaussian Splatting。主流范式有二:逐帧迭代形变场(deformation field)

方法发表机制关键数字局限
4D-GS(Wu et al.)CVPR 2024时空结构编码 + MLP 形变解码高保真动态重建依赖稠密多视角
Deformable 3D Gaussians(Yang et al.)CVPR 2024canonical + 形变 MLP 查 4D 坐标单目动态人体剧烈非刚性形变弱
Gaussian-Flow(Lin et al.)CVPR 2024 Highlight双域形变 DDDM:时域多项式 + 频域傅里叶训练较逐帧快 5×,~125 FPS长程剧烈运动受限
Scaffold-GS(Lu et al.)CVPR 2024锚点 anchor + 神经高斯,视图自适应减冗余、提质量动态扩展有限
MoDec-GS / MoSca / OriGS / ODE-GS / EvoGSCVPR/NeurIPS 2025运动分解、4D 脚手架、ODE 连续动力学时序外推、样本高效各擅一场,未归一

Devil’s Advocate 一击:上表所列,胜在「已被观测之域」。一旦遮挡、拓扑突变、视角外推,纯光度优化之形变场即现结构漂移(Ground4D 实证,见后)。此非枝节,乃 dynamic GS 之根本软肋。

四、第二汇流点:生成式 4D(创造维度)

重建只能「复现所拍」,生成方能「凭空造物」。4D 生成之难,不在多一维时间,而在几何、外观、运动、跨视角四项须同时稳。Miao 等(2025)之综述将范式析为四类:

  1. 端到端:直接学 4D 分布(理想终局,唯赖大数据);
  2. 生成中间数据:先造多视角/多时视频,再喂入既有 4D 重建管线(任务分解之智);
  3. 隐式蒸馏(SDS):以扩散为裁判,反复渲染—问差—反传,雕 4D 表示(灵活而贵);
  4. 显式监督:直接以参考视频/多视图/几何监督,效高可控(前层数据须可靠)。

Text/Image → 4D:DreamGaussian(Tang et al., ICLR 2024)以 2 分钟成 3D、约 10× 加速,开「GS + 生成」之先河;GaussianDreamer(Yi et al., 2023)桥接 2D 与 3D 扩散,造可操控高斯物体。

Video → 4D(2026 年之锋锐):

  • GenMOJO(Chu et al., CMU+TRI, 2025):多物体遮挡场景之 video-to-4D;
  • Ground4D(Zhao et al., 中山+清华, 2026, arXiv:2606.28828):以 3D 基础模型 VGGT 做训练免几何初始化,再以动态 GS 精炼,DyCheck 上 mPSNR 19.43 dB、Chamfer 0.226,正揭「纯光度优化致结构漂移」之病;
  • World from Motion / WfM(Zhu et al., 斯坦福+NVIDIA, 2026, arXiv:2607.01202):闭环最巧——初重建动态 3DGS → 渲染 RGB/Depth/Normal/3D Scene Flow 为 4D buffer → 条件化视频生成模型造「虚拟多视角」→ 深度反投影、增新高斯、重优 motion,写回单一一致 4DGS。DyCheck 19.78 mPSNR、MultiCamVideo 27.43 PSNR,俱为 SOTA。

五、第三汇流点:GS 作视频与世界模型表示

  • GaussianVideo(Bond et al., Koc+Adobe, ICCV 2025, arXiv:2501.04782):层次化 GS + Neural ODE 学连续相机运动 + B-样条运动 + 时空层次学习。不依赖预计算相机参,内存省、时序一致强;令高斯运动自然涌现语义连贯,非强监督光学流所迫。
  • WorldWarp(Kong et al., 新国大+理大, 2025, arXiv:2512.19678):以在线 3DGS 几何缓存为结构锚,以时空扩散 ST-Diff 为生成精炼;时变噪声调度——空白区满噪以生、扭曲区半噪以修,chunk-by-chunk 生成 200 帧长程几何一致视频。诀:3D 逻辑导结构,扩散逻辑完美纹理
  • D2GV(Liu et al., 交大+UMKC, 2025, arXiv:2503.05600):可变形 2D GS 表视频,GoP 并行、CUDA 光栅化,解码超 400 FPS,质量匹敌乃至超 INR,兼擅插帧/修复/去噪。

六、效率与压缩:让实时成为现实

显式表示之代价,在膨胀。三文为压缩立柱:LightGaussian(Fan et al., NeurIPS 2024 Spotlight, arXiv:2311.17245)15× 压缩、200+ FPS;3DGS.zip(Bagdasarian et al., CGF 2025)统九类模块之压缩综述;Splatwizard(Liu et al., 2025, arXiv:2512.24742)3DGS 压缩 Benchmark 工具包,使压缩可度量。

Devil’s Advocate 二击:压缩常以画质/编辑性为价。15× 之后,原语之「可编辑」优势是否尚存?此须以任务定夺,不可一概而论。

七、正反 PK:GS 真能推动视频生成飞跃否?

正方 · 技术乐观

  1. 显式即可控:每原语可读、可编辑、可绑定骨架,优于 NeRF 黑箱与视频像素;
  2. 实时即落地:百 FPS 渲染,使交互世界、数字人、自驾仿真可得;
  3. 可组合即系统:GS 作画布,扩散、物理、轨迹皆可叠加(WfM、WorldWarp 为证);
  4. 数据高效:以强模态先验雕弱模态,避端到端大数据之困。

反方 · 局限批判

  1. 存储/显存膨胀:原语数随复杂度线性涨,长程场景不堪;
  2. 拓扑难塑:拓扑突变、非刚大形变、烟雾毛发,变形场乏力(TagSplat, CVPR’26 直言开放);
  3. 物理与时间一致性薄弱:纯光度优化致结构漂移、长程时序漂移(Ground4D、WfM 共证);
  4. 多视角先验不一致:扩散「每帧似真、合之非一世界」,须几何回投约束;
  5. 透明/反射材质弱:逊于体渲染之 NeRF;锯齿闪烁犹在。
拍板(Devil’s Advocate 整合结论)。GS 非「取代扩散」,而为「承托扩散」之显式骨架。当下最优解,乃条件化混合表示:以几何(GS/3D 基础模型)立骨,以扩散(视频/多视图)补 flesh,以物理/轨迹/深度为约束回填。端到端 4D foundation model 固为终局,然在数据、统一生成框架、效率三项未齐前,混合表示最切实用。此与 Miao 等(2025)「先找承载问题之表示,再谈生成」之方法论,若合符节。

八、技术路线图与对比矩阵

静态 3DGS Kerbl’23 · 实时表示之基 引入时间 动态 / 4D 表示 4D-GS·Deform·Gaussian-Flow 引入生成先验 生成式 4D DreamGaussian→WfM·Ground4D 以 GS 为画布 视频 / 世界模型 GaussianVideo·WorldWarp·D2GV 压缩以落地 轻量部署 · 压缩 LightGaussian·3DGS.zip·Splatwizard 演进主轴:静态表示 → 动态 4D → 生成式 4D → 视频/世界模型画布 → 轻量部署;几何立骨、扩散补 flesh、物理/深度回填。 关键转折:2024 形变场范式成熟;2025–26 生成闭环(WfM/Ground4D)与视频表示(GaussianVideo/D2GV)齐发。
方法发表类型核心机制速度/指标一句话定位
3DGSSIGGRAPH’23静态表示显式高斯 + 可微光栅化100–300 FPS实时表示之基
4D-GSCVPR’244D 重建时空编码 + MLP 形变高保真动态入门
Deformable 3D GSCVPR’244D 重建canonical + 形变场单目人体形变场范式
Gaussian-FlowCVPR’24 HL4D 重建DDDM 双域形变~125 FPS, 5×快高效动态
Scaffold-GSCVPR’24静/动anchor + 神经高斯减冗余视图自适应
DreamGaussianICLR’24生成 4DGS + 扩散2 分钟成 3D生成先河
GaussianDreamer2023生成 4D桥接 2D/3D 扩散可操控text→4D
GenMOJO2025video→4D多物体遮挡重建DAVIS/MOSE遮挡场景
Ground4D2026video→4DVGGT 初始化 + GS 精炼mPSNR 19.43几何一致性
World from Motion2026video→4D虚拟观测蒸馏回 3DGSDyCheck 19.78闭环 SOTA
GaussianVideoICCV’25视频表示层次 GS + Neural ODE高/低动俱优世界模型雏形
WorldWarp2025世界模型在线 3DGS 缓存 + ST-Diff200 帧长程一致
D2GV2025视频表示可变形 2D GS>400 FPS极速解码
LightGaussianNeurIPS’24压缩剪枝+蒸馏+哈希15×, 200+ FPS压缩标杆

九、挑战与 Benchmark

  • 拓扑与一致性:拓扑一致动态网格(TagSplat, CVPR’26)、跨视角/长程时序漂移,仍为开放题;
  • 物理合理性:PhysTwin(ICCV’25)等倡物理信息重建,然「动得像真」未普适;
  • Benchmark 缺口:4D 评测多沿用 PSNR/SSIM/LPIPS/FVD/CLIP,抓不住「跨视角一致、长程漂移、几何-外观错配」之真败因(Miao et al., 2025 之警);
  • 统一框架:今之系统仍「图像扩散管外观、视频扩散管动、多视图管视角」,一致性多留后处理扛;
  • 数据:大规模、多条件、多动态类型之 4D 数据稀缺,端到端 foundation model 难立。

常用指标:PSNR、SSIM、LPIPS、FPS、显存占用、Chamfer Distance、mPSNR(DyCheck)、PCK@0.05(3D track)。

十、结论与展望

3DGS 与视频生成之汇流,非偶合,而因「一致性」这一共同焦虑。三年之间,已由静态表示(Kerbl’23)→ 动态 4D(CVPR’24 诸作)→ 生成式 4D(2025–26 之 WfM、Ground4D)→ 视频/世界模型画布(GaussianVideo、WorldWarp、D2GV),并以压缩(LightGaussian 等)谋落地。

拍板之见:短期以条件化混合表示为实用之锚——几何立骨、扩散补 flesh、物理/深度回填;长期则向统一 4D 生成框架大规模多条件数据挺进。凡涉交互式世界、数字人、自驾仿真、具身智能者,GS 与视频生成之合流,方其始也。

参考文献

Bagdasarian, M., et al. (2025). 3DGS.zip: A survey of 3D Gaussian Splatting compression. Computer Graphics Forum.

Bond, A., Wang, J.-H., Mai, L., Erdem, E., & Erdem, A. (2025). GaussianVideo: Efficient video representation via hierarchical Gaussian splatting. In ICCV. arXiv:2501.04782

Chu, et al. (2025). GenMOJO: Generating multi-object 4D scenes from monocular video. arXiv:2506.12716

Fan, Z., et al. (2024). LightGaussian: Unbounded 3D Gaussian compression with 15× reduction and 200+ FPS. In NeurIPS. arXiv:2311.17245

Guo, H., Weng, D., Su, M., et al. (2026). TagSplat: Topology-aware Gaussian splatting for dynamic mesh modeling and tracking. In CVPR. arXiv:2512.01329

Kerbl, B., Kopanas, G., Leimkühler, B., & Drettakis, G. (2023). 3D Gaussian Splatting for real-time radiance field rendering. ACM TOG, 42(4), 139. arXiv:2308.04079

Kong, H., Yang, X., Zheng, X., & Wang, X. (2025). WorldWarp: Propagating 3D geometry with asynchronous video diffusion. arXiv:2512.19678

Lin, Y., Dai, Z., Zhu, S., & Yao, Y. (2024). Gaussian-Flow: 4D reconstruction with dynamic 3D Gaussian particle. In CVPR (pp. 21136–21145). arXiv:2312.03431

Liu, M., Yang, Q., Zhao, M., Huang, H., Yang, L., Li, Z., & Xu, Y. (2025). D2GV: Deformable 2D Gaussian splatting for video representation in 400FPS. arXiv:2503.05600

Liu, et al. (2025). Splatwizard: A toolkit for benchmarking 3D Gaussian splatting compression. arXiv:2512.24742

Lu, T., et al. (2024). Scaffold-GS: Structured 3D Gaussians for view-adaptive rendering. In CVPR. arXiv:2312.00109

Miao, Q., Li, K., Quan, J., et al. (2025). Advances in 4D generation: A survey. arXiv:2503.14501

Tang, J., et al. (2024). DreamGaussian: Generative Gaussian splatting for efficient 3D content creation. In ICLR. arXiv:2309.16653

Wu, G., Yi, T., Fang, J., et al. (2024). 4D Gaussian Splatting for real-time dynamic scene rendering. In CVPR. arXiv:2310.08528

Yang, Z., Gao, X., Zhou, W., Jiao, S., Zhang, Y., & Jin, X. (2024). Deformable 3D Gaussians for animatable humans from monocular videos. In CVPR. arXiv:2309.13101

Yi, T., et al. (2023). GaussianDreamer: Text to manipulable 3D Gaussian objects with generated multi-view images. arXiv:2310.03585

Zhao, M., et al. (2025). Advances in 4D representation: Geometry, motion and interaction. In ICLR. (4DRep-GMI)

Zhao, Q., Deng, W., Wei, P., & Lin, L. (2026). Ground4D: Consistency-aware 4D reconstruction from monocular video. arXiv:2606.28828

Zhu, L., Huang, S., Mazumdar, A., Li, T., Gojcic, Z., Wetzstein, G., Armeni, I., De Mello, S., & Trevithick, A. (2026). World from Motion: Generative dynamic Gaussian reconstruction from monocular video. arXiv:2607.01202

来源分级铁律(deep-research):Tier 1 同行评审——3DGS(SIGGRAPH’23)、4D-GS/Deformable GS/Gaussian-Flow/Scaffold-GS(CVPR’24)、DreamGaussian(ICLR’24)、LightGaussian(NeurIPS’24)、GaussianVideo(ICCV’25)、TagSplat(CVPR’26);Tier 2 预印本——WorldWarp、D2GV、GenMOJO、Ground4D、World from Motion、GaussianDreamer、Miao 等 4D 生成综述、Zhao 等 4DRep-GMI、Splatwizard、3DGS.zip 综述。凡引皆经 WebSearch 核验编号、出处、数字,无「不可证引用」入库。
智柴 · 深度研究出品 | 交叉全景综述 | 成稿 2026-08-25 | 离线可读,无外部依赖

发表回复

人生梦想 - 关注前沿的计算机技术 acejoy.com 🐾 步子哥の博客 🐾 背多分论坛 🐾 借一步网 🐾 智柴网 沪ICP备2024052574号-1