人形机器人借助动作数据与动画掌握爬行、侧手翻和后空翻
研究人员开发出一种新的控制框架,使人形机器人(humanoid robot)能够完成敏捷动作,包括匍匐爬行、霹雳舞和后空翻。该系统名为零样本具身技能迁移(zero-shot embodied skill transfer,ZEST),利用强化学习从人体动作捕捉、视频和动画数据中教会机器人全身动作。与需要针对特定任务进行训练的方法不同,ZEST 允许机器人在部署前通过单一训练阶段学习广泛的动作。在 Boston Dynamics 的 Atlas、Unitree(宇树)的 G1 以及 Boston Dynamics 的 Spot 上进行的测试表明,这些机器人能够在不同的机器人躯体类型上完成爬行、侧手翻、倒立、足球踢球等复杂动作。
机器人学习动作
来自 RAI Institute 和 Boston Dynamics 的研究人员开发了 ZEST,这是一种强化学习框架,旨在为腿式机器人提供更灵活的方式,从动作数据中学习复杂的类人体动作。该系统旨在减少每项新机器人技能通常所需的工程工作和控制器调参。ZEST,即零样本具身技能迁移(Zero-shot Embodied Skill Transfer),可以从三种不同来源学习:高保真动作捕捉数据、单摄像头拍摄的普通视频,以及关键帧动画。来自动作捕捉和视频的人体动作通过运动学重定向(kinematic retargeting)转换为机器人兼容的格式,而动画则可以提供人类无法完成或更适合非人形机器人的动作。重要的是,该框架不要求演示数据包含明确标注机器人应在何时何地与地面接触的标签。
其核心技术是完全在仿真中训练、然后无需额外微调即可迁移到物理硬件上的强化学习策略。ZEST 使用相对简单的前馈策略,并且在部署时仅依赖机载本体感知测量。根据该团队发表的研究,它避免了复杂机器人控制流水线中常用的多个组件,包括状态估计器、长观测历史、未来参考窗口、接触时序表,以及大量针对特定任务的奖励工程设计。
ZEST 驱动敏捷性
一个关键特性是自适应采样。ZEST 并非对动作序列的每个部分进行均等训练,而是将轨迹划分为固定时长的片段,并跟踪机器人在每个片段上失败的频率。更困难的部分会被更频繁地采样,而最低采样概率则可防止较简单的技能被遗忘。该系统还使用基于施加在机器人基座上的虚拟模型辅助扳手(wrench)的自动课程机制。对于困难的动态动作,辅助力度最强,并随着策略的改进逐渐减小。
研究人员还针对踝关节、膝关节和腰部等关节中使用的闭链平行连杆执行器开发了简化模型。这些近似方法在保留重要执行器动态特性的同时降低了仿真复杂度。ZEST 还纳入了功率限制、电机饱和、传动损耗和摩擦等执行器效应,以改善仿真到真实世界的迁移(sim-to-real)。
该方法在 Boston Dynamics 的 Atlas、Unitree 的 G1 以及 Boston Dynamics 的 Spot 四足机器人上进行了测试。单个策略在单张 NVIDIA L4 GPU 上需要约 10 小时(约 7,000 次迭代)的训练。在 Atlas 上,ZEST 复现了包括爬行、前滚翻、侧手翻、匍匐爬行和霹雳舞在内的动作。从视频学到的技能包括跳舞、足球踢球和攀爬箱子,而动画则使 Spot 能够完成连续后空翻和侧滚翻。
研究人员表示,ZEST 可以简化从人体动作数据到机器人控制的路径,但它仍局限于平坦、不湿滑的环境,且尚未证明能泛化到完全未见过的动作。未来的工作包括零样本和少样本自适应、持续学习、基于语言或关键帧的控制,以及将高层指令转换为可执行机器人动作的生成式系统。