ActFovea:基于时空视觉-动作一致性的 VLA 策略运行时安全防护
原标题:ActFovea: Runtime Safeguarding for VLA Policies via Spatiotemporal Visual-Action Consistency
标题:ActFovea:基于时空视觉-动作一致性的 VLA 策略运行时防护
arXiv:2607.29169v1 公告类型:新发布 摘要:视觉-语言-动作(VLA)策略在机器人操作中表现出色,但仍易受运行时扰动的影响,这些扰动会破坏视觉观测、机器人状态与执行动作之间的时间对齐。我们提出 ActFovea,一个即插即用的防护框架,无需重新训练或修改底层 VLA 策略即可检测并缓解此类故障。ActFovea 利用机器人运动学、本体感知状态和近期动作,构建以动作为条件的中央凹区域,保留接触相关区域和预测的运动走廊,同时抑制与任务无关的视觉内容。它通过评估视觉运动和观测新鲜度是否与几何、本体感知和动作转换保持一致来检测运行时风险。对于可恢复的扰动,ActFovea 构建针对特定扰动的候选观测,并且只有在验证由此产生的动作块之后才接受恢复。当陈旧或重放的观测使可靠恢复变得不可能时,它会启动一个有界的安全失效程序。在 π₀ 于多个 LIBERO 套件上的闭环评估中,ActFovea 将局部视觉遮挡下的成功率从 49.3% 提升至 90.3%,弥合了与干净性能之间 93.7% 的差距。它还在动作漂移和视觉延迟情况下分别将成功率提高了 7.0 和 9.8 个百分点,同时保持了干净任务的性能。在冻结观测重放情况下,ActFovea 在所有试验中都及时触发安全失效,没有出现未受防护的故障。这些结果表明,时空视觉-动作一致性为 VLA 策略的运行时防护提供了有效的基础。