论文
ELASTIC:有效学习自适应扩展生成控制策略的测试时间计算
ELASTIC: Efficiently Learning to Adaptively Scale Test-Time Compute for Generative Control Policies
摘要
生成控制策略(GCP),例如扩散策略和基于流的视觉语言动作模型,可以在机器人控制中实现测试时间扩展。测试时计算可以沿两个轴分配:顺序缩放(增加去噪步骤以细化操作)和并行缩放(对多个候选操作进行采样以跨策略分布模式进行搜索)。然而,顺序和并行计算的最佳分配很难先验地知道,因为它依赖于状态、任务和策略。例如,掌握的早期阶段可能会受益于更广泛的并行探索,而近接触阶段可能需要更多的顺序细化以提高精度。我们提出了 ELASTIC,这是一种学习 GCP 的状态相关测试时间计算计划的算法。我们将计算分配制定为元马尔可夫决策过程,其中元策略与冻结的预训练机器人策略交互,并在每次去噪迭代时选择顺序步骤和并行样本,以最大限度地提高任务成功率,同时最大限度地减少计算量。使用强化学习,该元策略还可以学习自适应计算计划,而无需访问 GCP 的训练数据。在具有扩散策略的模拟操纵基准中,ELASTIC Pareto 在匹配的计算预算下主导固定和单轴缩放基线。在使用 $π_{0.5}$ 视觉-语言-动作模型进行现实世界的机器人操作时,ELASTIC 达到了 $10$ 的最佳成绩,同时将挂钟延迟减少了 34%。