EMBODIED DAILY

Motus2:面向灵巧操作的自进化通用世界模型

原标题:Motus2: A Self-Evolving General World Model for Dexterous Manipulation
Motus2:面向灵巧操作的自进化通用世界模型

arXiv:2608.30237v2 公告类型:替换(replace) 摘要:通用具身智能体应当在一个统一的系统中完成感知、预测、行动、评估与改进。世界模型在构建此类智能体方面已展现出巨大潜力,然而现有模型通常只是在一个世界模拟器上附加一个动作输出头,而没有将二者耦合为一个用于策略改进的闭环决策-学习回路。我们提出 Motus2,一个面向灵巧操作的自我进化通用世界模型。Motus2 通过模型扩展(model scaling)和数据扩展(data scaling)推进世界建模。在模型扩展方面,一个共享权重的单一模型对外提供三个控制接口:一个策略(世界-动作模型)、一个模拟器(动作条件世界模型)和一个评估器(价值模型)。策略提出候选动作块(action chunks),模拟器预测其视觉后果,评估器对预测结果进行评估。三者的耦合构成了一个用于策略改进的闭环决策-学习回路。这一设计利用精选的专家演示进行动作学习,同时失败和次优的交互为动力学建模和价值学习提供了宝贵的证据。在数据扩展方面,Motus2 从大规模单目第一视角(egocentric)数据出发,逐步过渡到同步的双目立体第一视角数据,随后利用机器人轨迹和补充的人-机器人对齐数据进行机器人领域适配。Motus2 还进一步研究了其滑动窗口上下文的全局自回归(global-autoregressive)扩展和混合记忆(hybrid-memory)扩展,引入触觉感知以实现接触感知控制,并在一个完全仿生的平台上进行了实例化,该平台配备双目立体视觉、双臂、双灵巧手和触觉感知。总体而言,第一视角数据扩展与闭环通用世界模型扩展相结合,为实现自我进化的灵巧操作提供了一条通用路径。

← 返回第 31 期 阅读原文(arXiv cs.RO)↗