继续还是重新计划?自适应地平线执行的伯努利连续策略学习
Continue or Replan? Bernoulli-Continuation Policy Learning for Adaptive Horizon Execution
摘要
现有的基于块的视觉语言动作(VLA)模型在重新计划之前执行固定数量的动作(即执行范围),将重新计划转变为与任务进度无关的任务无关的定期计划。因此,当没有重新规划边界落在关键操作阶段之前时,它将从陈旧的块而不是新重新规划的块中执行。为了解决这一限制,我们提出了伯努利连续策略(BCP),这是一种轻量级、即插即用的自适应水平执行框架,可保持基本 VLA 冻结。给定一个固定长度的动作块,它的延续头将执行范围选择分解为一系列继续或重新计划决策,这对候选范围施加有序的、前缀共享的归纳偏差,而不是将它们视为独立的类。由于每个块的最佳视野是不可观察的,因此我们通过轨迹级结果的强化学习来训练该头部,并引入重新规划效率奖励,共同奖励任务成功和有效的 VLA 使用,防止策略崩溃到不必要的短视野。在以 LingBot-VLA 作为基本策略的 RoboTwin 2.0 上,BCP 将 13 个低成功任务的平均成功率提高了 +11.08%,并将所有 50 个任务的平均成功率从 89.88% 提高到 93.94%(+4.06%)。尽管仅在 Clean 设置下进行训练,但 BCP 可以推广到随机设置,将平均成功率提高了 +4.06%。它还转移到不同的基本策略 $π_{0.5}$,在 LIBERO (+1.7%) 上取得更好的结果,尤其是在更难的 LIBERO-PRO (+6.8%) 上。在真实的机器人上,BCP 将两项操作任务的成功率从 74% 提高到 92%,从 44% 提高到 84%。同时,其可忽略不计的开销加上更高的成功率,使得 BCP 的整体运行时间甚至低于固定范围基线。