继续执行还是重新规划?面向自适应执行时域的 Bernoulli-Continuation 策略学习
arXiv:2608.03483v1 公告类型:新发布
摘要:现有的基于动作块(chunk)的 Vision-Language-Action(VLA)模型在重新规划之前会执行固定数量的动作(即执行时域),这使得重规划变成一种与任务无关的周期性调度,与任务进展无关。因此,当关键操作阶段之前没有重规划边界时,该阶段将基于过时的动作块执行,而不是基于新规划的动作块。为了解决这一局限,我们提出了 Bernoulli-Continuation Policy(BCP),这是一个轻量级、即插即用的自适应时域执行框架,能够保持基础 VLA 冻结不变。在给定固定长度动作块的情况下,其延续头(continuation head)将执行时域的选择分解为一系列"继续或重规划"的决策,从而在候选时域上施加一种有序的、前缀共享的归纳偏置,而不是将它们视为相互独立的类别。由于每个动作块的最优时域不可观测,我们利用轨迹级结果通过强化学习训练该延续头,并引入了 Replanning-Efficiency Reward(重规划效率奖励),该奖励同时奖励任务成功和高效的 VLA 使用,防止策略坍缩到过短的时域。在 RoboTwin 2.0 上,以 LingBot-VLA 作为基础策略,BCP 在 13 个低成功率任务上将平均成功率提升了 +11.08%,并在全部 50 个任务上将成功率从 89.88% 提升至 93.94%(+4.06%)。尽管仅在 Clean 设置下训练,BCP 仍能泛化到 Randomized 设置,将平均成功率提升 +4.06%。它还可以迁移到不同的基础策略 $\pi_{0.5}$,在 LIBERO 上取得了更好的结果(+1.7%),尤其在更难的 LIBERO-PRO 上表现突出(+6.8%)。在真实机器人上,BCP 将两个操作任务的成功率分别从 74% 提升至 92%、从 44% 提升至 84%。与此同时,其微不足道的开销加上更高的成功率,使 BCP 的整体运行时间甚至低于固定时域的基线方法。