EMBODIED DAILY

Gemini Robotics ER 2:以视频理解、任务编排与多机器人协作驱动机器人能力升级

原标题:Gemini Robotics ER 2: powering robotics with video understanding, task orchestration, and multi-robot collaboration

Gemini Robotics ER 2 代表了机器人赋能方式上的一次阶跃式变革,它集视频理解、任务编排与多机器人协作能力于一身——让机器人能够在物理世界中发挥更大的作用。

我们正式推出 Gemini Robotics ER 2,这是一个旨在充当机器人高级大脑的新模型。它实现了实时空间推理、多步任务规划以及不同机器人之间的协作。你现在就可以通过 Gemini API、Google AI Studio 或 Gemini Enterprise Agent Platform 访问该模型,开始构建你自己的物理 AI 智能体。

Google 刚刚发布了 Gemini Robotics ER 2,它就像机器人的智能大脑。它帮助机器人快速思考、规划多步任务,甚至与其他机器人协同工作。该模型让机器人能够观看视频流,实时跟踪自身的任务进度并纠正错误。它的设计目标是让机器人在真实世界中更安全、更有用。

机器人要想在日常环境中协助人类,仅有精确的空间推理是不够的。机器人还必须快速思考,让自己的决策和推理节奏与物理世界的实时速度相匹配。

这正是我们今天推出 Gemini Robotics ER 2 的原因——它是我们面向机器人领域最强大的"具身推理"模型。你可以把 Gemini Robotics ER 2 想象成机器人的高级大脑。它让机器人能够与人类对话、理解物理世界,并规划多步任务。随后,它会将运动执行交给任意给定的低层视觉-语言-动作(VLA)模型。Gemini Robotics ER 2 还可以原生调用 Google Search 等工具来查找信息,或调用任何其他用户自定义的函数。Gemini Robotics ER 2 的设计让机器人能够在执行动作的同时"思考"下一步该做什么。

Gemini Robotics ER 2 相较于 Gemini Robotics ER 1.6 是一次重大升级。通过观看连续的视频流,机器人现在可以跟踪自身的任务进度,在出现问题时进行调整,并准确知道何时进入下一步。我们还引入了多机器人协作能力,使机器人能够在共享空间中协同工作,完成单个机器人无法独立完成的复杂工作流程。

Gemini Robotics ER 2 现已通过 Gemini API 和 Google AI Studio 向开发者公开开放,并在 Gemini Enterprise Agent Platform 上提供非公开预览。为了帮助你上手,我们分享了一些示例,展示如何配置该模型以及如何对其进行提示(prompt),以驱动更有用的物理 AI 任务。

物理世界中的大多数任务都很复杂,需要多个步骤才能完成。Gemini Robotics ER 2 是一个物理智能体,它为机器人编排各个步骤,使机器人能够自我纠正,并泛化到更多新颖的场景。为了构建智能体化(agentic)的配置,开发者可以将低层控制接口——如视觉-语言-动作(VLA)模型或导航 API——声明为工具,并将多模态的视频、音频或文本直接流式输入模型。

Gemini Robotics ER 2 改进了这一工具编排工作流程。我们可以在仿真环境中用机器人评估其性能,可以使用真实世界的机器人控制,甚至可以将其与远程操控机器人的人类配对使用。

在三种控制模式下——真实 VLA、仿真 VLA 和人类遥操作——Gemini Robotics ER 2 在工具编排方面始终优于 ER 1.6。

在机器人领域,高层推理依赖于执行速度。Gemini Robotics ER 2 集成到了 Gemini Live API 中,使用为延迟敏感型任务优化的双向流式端点。其结果是流畅的编排:Gemini Robotics ER 2 指挥动作模型和机器人 API 完成多步任务,而不会出现突兀的"停下来思考"的停顿。为了说明这一点,我们与合作伙伴 Boston Dynamics 的 Spot 一起构建了一个演示。我们使用 Gemini Robotics ER 2 来编排 Spot 的 API,例如导航和机械臂运动,打造出一个可以为你取物的交互式机器人。

由 Gemini Robotics ER 2 驱动的 Boston Dynamics Spot 根据自然语言指令取来了一份爆米花零食。

相关代码已在 Github 上与其他示例一同发布。

机器人领域最难的挑战之一是知道任务何时完成。Gemini Robotics ER 2 在视频理解和进度跟踪方面带来了阶跃式的提升,能够在切换到下一个任务之前,验证复杂任务——例如拧紧灯泡或扎紧垃圾袋——是否已按照规范完成。

在此次更新中,我们在任务进度理解的两项基础能力上取得了进展:进度分类和关键时刻定位。

进度分类是指机器人跟踪任务完成进度的能力。在我们的评估中,我们将视频流中的每一帧划分到五个进度等级(0-20%、20-40%、40-60%、60-80%、80-100%)。通过量化任务进度,Gemini Robotics ER 2 为机器人提供了实时的态势感知能力,使它们能够动态调整动作或重试失败的步骤,而无需重启整个工作流程。

Gemini Robotics ER 2 达到了 57.4% 的准确率

← 返回第 1 期 阅读原文(Google DeepMind Blog)↗