EMBODIED DAILY

HAF:通过分层动作流与频谱潜在强化学习将通用 VLA 适配于人形机器人全身运动操作

原标题:HAF: Adapting Generalist VLAs to Humanoid Whole-Body Loco-manipulation via Hierarchical Action Flow and Spectral Latent RL
HAF:通过分层动作流与频谱潜在强化学习将通用 VLA 适配于人形机器人全身运动操作

arXiv:2608.16837v1 公告类型:new

摘要:人形机器人(humanoid robot)在以人为中心的环境中作为通用智能体具有巨大潜力,然而通用视觉-语言-动作(VLA)基础模型并不能直接应用于人形机器人的全身移动操作(whole-body loco-manipulation)。人形机器人动作的高维度和相互依赖性,使得传统的单阶段VLA架构难以有效协调行走、腰部姿态与双臂操作。此外,通过离线行为克隆训练的策略在真实世界部署中可能仍处于次优状态。尽管在线强化学习(RL)可以通过真实世界交互来优化策略,但直接微调大型VLA主干网络需要大量计算,并可能在真实机器人探索过程中引入安全风险。

为解决这些瓶颈,我们提出HAF(Humanoid Adaptation Framework),这是一个由HAF-VLA和HAF-Steer两部分组成的框架,可将现成的通用VLA基础模型迁移到人形机器人全身移动操作任务。HAF-VLA是一个构建在预训练flow-matching VLA之上的分层动作流生成器。它将全身动作去噪拆分为三个顺序阶段,并引入阶段嵌入(stage embeddings)与跨阶段KV缓存(cross-stage KV caches)来保留运动学依赖关系,从而避免一次性生成导致的不连贯全身动作。在冻结的HAF-VLA之上,HAF-Steer是一个隐空间离线到在线(offline-to-online)RL流水线,它利用flow-matching的可逆性和基于DCT的降维方法,将RL优化限制在紧凑的噪声子空间内,并训练一个正则化的SAC策略。这避免了对大型VLA主干网络的更新,实现了高效的真实世界策略优化。

在七个真实世界人形机器人移动操作任务上的评估表明,HAF超越了原始的单阶段VLA基线,提升了全身协调性和任务表现。项目网站:https://grange007.github.io/HAF 。

← 返回第 20 期 阅读原文(arXiv cs.RO)↗