NVIDIA Cosmos 3:把世界模型从「视频生成器」升级成「物理 AI 全模态基础」

英伟达 5 月 31 日(北京时间)在 Computex 2026 上正式发了 Cosmos 3。8 月 6 ...

英伟达 5 月 31 日(北京时间)在 Computex 2026 上正式发了 Cosmos 3。8 月 6 日 NVIDIA Blog 跟进了一篇《Open World Models Power the Next Frontier of Physical AI》——这是 Cosmos 3 第一次以「世界模型 = 物理 AI 全模态基础」叙事正式对外。

Cosmos 3 不是一个模型,是三个规格

Cosmos-3 Super(64B):旗舰,物理仿真、机器人策略学习、自动驾驶场景生成的主力 – Cosmos-3 Nano(16B):边缘 / 嵌入式部署,延迟敏感场景 – Cosmos-3 Edge(4B):板级 / GPU-less 设备,目标机器人本体或车机端

架构采用 MoT(Mixture of Transformers)双塔——一个塔跑视频与图像 token,另一个塔跑文本、动作、传感器信号;通过 cross-attention 在中间层做多模态融合。这与 Cosmos 1 的单 Transformer、Cosmos 2 的 late-fusion 都不同。

训练数据是13 亿数据点(不是 token),分布大致是:

– 视觉:约 8500 万小时仿真视频 + 真实驾驶 / 机器人遥操作片段 – 动作:约 4.5 亿条(机器人关节序列、自动驾驶轨迹、灵巧手动作) – 文本 / 标注:约 2.8 亿条(任务描述、场景标注) – 传感器:约 1.2 亿条(IMU、力矩、深度)

数字披露到这一层为止。参数量、训练 token 总量、训练算力(GPU 小时)三个核心数字均未公开——这与英伟达一贯「模型权重可下、训练成本不透明」的策略一致。

许可证是 NVIDIA Open Model License(W)v1.1(OpenMDW)——商用、修改、衍生、再分发都允许,但有几条限制:

– 不能用于军事 / 武器系统 – 不能用于生成违反 NVIDIA 可接受使用政策的合成媒体(deepfake 等) – 衍生模型必须保留 OpenMDW 许可证

这比 Cosmos 1 / 2 的非商用许可是放宽的,第三方可以基于 Cosmos 3 做产品。早期采用者包括 1X、Boston Dynamics(部分研究合作)、Figure AI、Skydio、Uber ATG 衍生团队、清华大学(X-Lab)、UC Berkeley BAIR、Stanford 李飞飞团队等。

Cosmos 1(2025 年 1 月)解决「能不能用 diffusion 模型生成物理合理的视频」,Cosmos 2(2025 年中)解决「能不能加条件控制(语言、动作、传感器)」,Cosmos 3 解决的是统一视觉、动作、文本的多模态基础——三件事在同一组权重里跑通。这意味着开发者不再需要「视频模型 + 策略模型 + 控制模型」的拼装栈,Cosmos 3 自己就能从「我看到 X」直接跳到「我应该做 Y」。

与英伟达现有体系的关系:

GR00T(人形机器人基础模型):Cosmos 3 是 GR00T 的「视觉大脑」,GR00T 用 Cosmos 3 做场景理解与预测 – Isaac Sim / Isaac Lab(仿真平台):Cosmos 3 训练数据的主要来源是 Isaac Sim 的合成数据;Isaac Lab 是 Cosmos 3 的 RL fine-tuning 平台 – Omniverse(3D 协作平台):Cosmos 3 不直接跑在 Omniverse 里,但 Omniverse 是开发者调试 Cosmos 3 输出场景的工具

跟 Genie 3(Google DeepMind 的世界模型,2025 年底发)、Veo 3(Google 视频生成)、Sora 2(OpenAI 视频生成)横向比,Cosmos 3 的差异化点是「动作 token 是第一公民」——其他三个把视频当输出,Cosmos 3 把动作和视频并列。这与「世界模型从生成器走向 reason-then-render」的近期判断一致(Genie 3 也是同方向但走的路径不同)。

来源: – NVIDIA Blog 08-06:https://blogs.nvidia.com/blog/open-world-models-physical-ai – NVIDIA Cosmos 3 产品页(GitHub README / HuggingFace 同步):https://github.com/NVIDIA/Cosmos – NVIDIA OpenMDW 1.1 许可证全文:https://developer.download.nvidia.com/licenses/nvidia-open-model-license-agreement-june-2024.pdf – Reuters / CNBC 08-06 报道:https://www.reuters.com/technology/nvidia-cosmos-3-physical-ai-2026-08-06/ – VentureBeat「Cosmos 3 是物理 AI 的 GPT 时刻」评论:https://venturebeat.com/ai/nvidia-cosmos-3-physical-ai-gpt-moment/ – The Decoder 08-06 报道:https://the-decoder.com/nvidia-cosmos-3-world-foundation-model/

判断:Cosmos 3 不是「又一个视频生成模型」,是把「视频生成、动作预测、视觉推理」三件事打包成同一个 Transformer 权重——这是世界模型从「分立工具栈」走向「统一基础」的关键拐点。对机器人、自动驾驶、AR/VR 这三条赛道,「世界模型」从研究课题变成基础设施。Genie 3、Veo 3、Sora 2 在「视频生视频」维度领先,但只有 Cosmos 3 把「动作」作为 first-class 公民——这条路上 NVIDIA 目前是孤品。

限制: – 训练算力 / 总 token / 双塔各自参数量均未公开 – 「13 亿数据点」的「点」如何定义未细化(按帧 / 段 / token?) – 6 家创始联盟与 11 家早期采用者具体名单与各自用例披露不全 – 早期采用者列表里出现「波士顿动力」等大牌需独立核验(NVIDIA 一贯的 marketing 倾向) – Cosmos 3 与 Cosmos 1/2 的纵向对比评测(生成质量、动作预测准确率、推理延迟)官方未给基准 – 与 Genie 3 / Veo 3 / Sora 2 的横向对比,NVIDIA 自己不做,由第三方评测填补 – 「OpenMDW 1.1 商用许可」对训练数据来源、衍生模型权重的限制条款,律师视角需要单独 review

发表回复

人生梦想 - 关注前沿的计算机技术 acejoy.com 🐾 步子哥の博客 🐾 背多分论坛 🐾 借一步网 🐾 智柴网 沪ICP备2024052574号-1