EMBODIED DAILY

WholeBodyWAM:基于可扩展运动先验学习人形全身世界动作模型

原标题:WholeBodyWAM: Learning Whole-Body World Action Models with Scalable Motion Priors
WholeBodyWAM:基于可扩展运动先验学习人形全身世界动作模型

人形全身操作需要协调的全身动力学,但直接采集目标机器人的大规模轨迹成本高昂且难以扩展。相比之下,人类和人形机器人来源的全身动作数据丰富易得,只是这些数据不能直接用作用于特定本体的机器人动作。

本研究提出 WholeBodyWAM,一种人形世界动作模型,通过在目标机器人训练之前学习大规模异构运动数据中的全身动力学,将这些可扩展的运动资源转化为可迁移的预测先验。

研究团队整理了 UniMotion-4K 运动语料库,涵盖来自人类视频、原生 3D 动作数据集和异构人形平台的超过 4000 小时数据,并将这些异构来源规范化到统一的动作空间中。随后,一个语言条件化的 Motion Expert 在不依赖目标机器人动作监督的情况下预训练未来全身运动预测。

在机器人后训练阶段,预训练的 Motion Expert 通过非对称 Mixture-of-Transformers(MoT)注意力机制与 Video Expert 和 Action Expert 融合,使预测性场景动力学和全身运动共同指导特定本体的动作生成。

实验表明,WholeBodyWAM 持续受益于运动预训练规模的扩大,改善了未来运动预测和下游任务表现,并能有效迁移到真实世界人形操作。此外,预训练的运动先验显著提高了在有限目标机器人演示数据下的数据效率。

← 返回第 35 期 阅读原文(arXiv cs.RO)↗