DECOWAM:面向腿式移动操作的解耦全身世界-动作模型
原标题:DECOWAM: Decoupled Whole-Body World-Action Model for Legged Mobile Manipulation
移动操作要求机器人预测自身运动与手臂动作如何共同改变未来观测与控制信号。然而,现有世界-动作模型大多面向固定基座平台,没有明确区分相机自运动与躯干、手臂动作。
为此,研究者提出 DECOWAM(Decoupled Whole-Body World-Action Model),一种通过专用条件接口分离这些因素的全身世界-动作模型。DECOWAM 冻结了经过适配的 FastWAM 主干网络,并训练残差适配器、从特权观测中蒸馏得到的动作等价未来瓶颈、对抗分离的躯干与手臂隐变量,以及用于视频预测的躯干速度条件。
研究者还发布了 ARMDOG 真机数据集,同步记录视频、全身状态、动作与语言。在固定回放协议下,DECOWAM 在未来视频预测和动作预测上均优于 FastWAM,仅使用 25.95M 可训练适配参数就将动作均方误差降低 21.7%。
在每种方法各 79 次闭环试验中,DECOWAM 实现了最高的全身协调性和躯干位移鲁棒性,同时任务完成率仍与最强基线相当。这些结果表明,具身感知的因子化解耦可以在移动视角下,以较少的参数实现联合视觉预测与全身控制。