Google DeepMind 新 AI 模型可控制人形机器人(humanoid robot)全身
Gemini Robotics 2 控制人形机器人,从"双脚到指尖"。
Gemini Robotics 2 控制人形机器人,从"双脚到指尖"。
Google DeepMind 表示,其 Gemini Robotics AI 模型的最新版本可以"控制整个人形机器人"。根据周四发布的一份公告,此前的模型专注于控制人形机器人的上半身,而 Gemini Robotics 2 现在支持从双脚到指尖的"全身动作"。
新模型将使人形机器人能够执行更广泛的动作,因为它允许机器人行走、下蹲、伸展和操作物体。Google 分享的视频展示了 Apptronik 的 Apollo 2 机器人如何弯腰捡起浇水壶,以及如何找到并从货架上取下特定物品。
尽管 Google DeepMind 指出其机器人"在移动速度方面还有更多需要改进之处",但它补充说,这次更新"是迈向完成更复杂的现实任务所需技能的重要一步,这些任务需要全身协调(whole-body coordination)"。
此外,Gemini Robotics 2 支持更强的灵巧性,因为它现在可以控制更复杂的五指灵巧手。这使机器人能够执行诸如密封 Ziploc 保鲜袋、扎紧垃圾袋或拧下灯泡等任务。
Google DeepMind 还在更新 Gemini Robotics ER(embodied reasoning,具身推理),这是一个视觉-语言模型,可帮助机器人分析周围环境、处理指令并执行多步骤任务。Gemini Robotics ER 2 更擅长在较长时间内完成任务,并且"现在能理解任务何时开始和结束"。
Google DeepMind 表示,这次更新还允许多个不同类型的机器人协同工作并完成任务,其中一段视频展示了 Apollo 2 如何指挥 Google 的双臂机器人在清理车库时将工具放入箱子中。
该公司指出,Gemini Robotics ER 2 是其"迄今为止最安全的机器人模型",因为它可以"更好地检测附近是否有人类,触发安全工具调用,并在有人靠得太近时让机器人安全停止"。
与此同时,Google DeepMind 还改进了其 Gemini Robotics On-Device Model(端侧模型),该模型无需互联网连接即可在机器人上本地运行。该模型现在可以更快地适应新的机器人形态(embodiment),包括那些"形状、传感器和自由度(DoF)截然不同"的形态。