Gemini Robotics 2 把「物理 AI」拆成三件套:一个大脑、一双手、一台本地副本

# Gemini Robotics 2 把「物理 AI」拆成三件套:一个大脑、一双手、一台本地副本 2026 ...

Gemini Robotics 2 把「物理 AI」拆成三件套:一个大脑、一双手、一台本地副本

2026 年 7 月 30 日,Google DeepMind 一次性把 Gemini Robotics 系列从「桌面机械臂」推到了「全身人形机器人」。这次不是一次模型升级,而是把整套栈拆成了三个互相协作的模型:VLA 主干 Gemini Robotics 2、具身推理大脑 Gemini Robotics ER 2、本地副本 Gemini Robotics On-Device 2。

三个模型怎么分工

之前的 Gemini Robotics 1.x 系列重点放在上半身桌面操作和静态场景。这次 DeepMind 把机器人智能明确分成了三个层次:

Gemini Robotics 2 (VLA):视觉-语言-动作主干模型,把摄像头画面加自然语言指令直接翻译成电机控制信号。重点是从「手指到脚趾」的全身控制——以前导航模型和操作模型分两段,现在 VLA 自己处理从行走到蹲下到拿取这一整条连续动作链。Apptronik 的 Apollo 2 在 demo 里,接到一条「把洒水壶放到最下层架子的绿色箱子里」的指令后,自己走过去、捡起来、蹲下、把壶放进箱子,中间不需要切换子任务。

Gemini Robotics ER 2 (具身推理大脑):VLM 派的高层规划者,负责拆解几分钟到几十分钟的长任务、追踪进度、协调多机器人协作、能调用 Google Search 或自定义函数。ER 2 现在通过 Gemini Live API 接入双向流式端点,延迟压到亚秒级,可以一边让底层 VLA 执行、一边推理下一步。

Gemini Robotics On-Device 2:本地推理版本,面向低延迟或弱网场景。它的卖点是迁移速度快——用不到 200 条示范数据、几小时就能把模型迁移到一台全新的机器人本体上。

数字到底涨了多少

DeepMind 这次给的 benchmark 数字很直白:

抓取成功率:桌面 68.4%,架子上 76.3%,精确插孔任务 89.6%。离人还差一截,但已经能跑工业装配的试运行了。 – 任务进度分类 (5 档 0–100%):ER 2 准确率 57.4%,优于上一代 ER 1.6 和其它前沿模型。 – 关键时刻定位 (moment-finding):准确率 91.3%,平均绝对时间误差 0.96 秒,执行速度是上一代的 4 倍。这是机器人能用「够了,停」做反馈的关键能力——比如倒咖啡要识别杯子什么时候满。 – 空间 VQA 与仪表读数:从圆形表盘扩展到数字屏、线性刻度、尺子和液体温度计,覆盖 10 类仪表。

ER 2 的两个指标意义不一样:进度分类决定机器人能不能在「找不到工具」或「碰到障碍」这种中途出错时不重头来过;moment-finding 决定它能不能在精确的时机切换任务(比如拧完灯泡立刻放手去拿下一颗螺丝)。这两个指标是过去 VLA 一直做不到的,ER 2 用 VLM 当大脑才补上。

硬件伙伴网络这次拉得很广

DeepMind 同时官宣了一长串硬件合作伙伴,基本覆盖了主流人形机器人厂商:

Apptronik:Apollo 2 人形机器人,演示了全身协调。 – Boston Dynamics:Atlas(人形)和 Spot(四足),Spot 演示由 ER 2 通过 Live API 调用 Spot SDK,做「拿爆米花」这种自然语言指令。 – Agile Robots:工业臂场景。 – Franka:F3 Duo 双臂平台,演示与 Apollo 2 协作。 – Sharpa:SharpaWave 22-DoF 触觉手,做打结、撕保鲜膜这种精细操作,也是 NVIDIA Isaac GR00T 参考设计的硬件之一。

加上同步发布的 ASIMOV-Agentic benchmark 和 Safety Technical Report,ER 2 在「人体接近感知」和「安全指令遵循」上也跑赢 ER 1.6。简而言之:模型本体不是宣传重点,DeepMind 这次想强调的是「栈」和「生态」。

可用性与我的判断

现在 ER 2 通过 Gemini API、Google AI Studio 公开给开发者,Gemini Enterprise Agent Platform 私有预览;VLA 主干和 On-Device 2 还在早期合作伙伴手里。要跑起来,得用 DeepMind 在 google-gemini/robotics-samples 这个仓库给的 notebook,先把 Spot 接好。

我的判断:这次发布标志着 DeepMind 把机器人赛道从「卖模型」转向「建生态」——三个模型+五家硬件+两套 benchmark,等于把 2026 下半年的具身竞争拉到了 NVIDIA Cosmos 1X Neo、Figure Helix 同一档的「全栈对全栈」格局。值得注意的是,ER 2 的 91.3% moment-finding 配 0.96 秒误差是目前公开数据里最接近工业装配节奏的指标,上海、东京、首尔的工业场景应该会率先试单。

参考: – DeepMind 官方博文: https://deepmind.google/blog/gemini-robotics-er-2-powering-robotics-with-video-understanding-task-orchestration-and-multi-robot-collaboration – 模型卡: https://deepmind.google/models/model-cards/gemini-robotics-er-2/ – 安全报告: https://storage.googleapis.com/deepmind-media/gemini-robotics/Gemini-Robotics-2-Safety.pdf – 演示代码: https://github.com/google-gemini/robotics-samples

发表回复

人生梦想 - 关注前沿的计算机技术 acejoy.com 🐾 步子哥の博客 🐾 背多分论坛 🐾 借一步网 🐾 智柴网 沪ICP备2024052574号-1