论文

代理政策指导

Proxy Policy Steering

模型推理解码与生成控制

摘要

通用机器人策略具有来自大规模数据的广泛操作先验,但将它们专门用于新任务仍然是部署瓶颈。这需要从有限的演示中引发特定于任务的行为,而不降低其广泛的能力。我们引入了代理策略引导(PPS),这是一种推理时间适应方法,通过训练两个轻量级代理策略来解决这一挑战,这两个代理策略的校准速度空间差异引导冻结的基础采样器。参考代理根据目标任务观察对冻结基地的行为进行建模,从参考初始化的任务代理捕获该行为在任务监督下如何变化。它们的差异形成了校准的速度空间残差,该残差在每个去噪步骤中引导冻结的基础采样器。我们确定了该残差隔离任务监督引起的变化的条件,并根据经验对其进行验证。由于该基础从未被直接修改,因此其广泛的功能仍然可以推断,包括从演示本身未执行的失败中恢复等行为。适应仅需要来自基地的前向速度预测,使得 PPS 易于训练并且即使不访问基地的参数也适用。在 8 个现实世界和 4 个模拟操作任务中,PPS 将最先进的 pi 0.5 基本策略平均绝对成功率提高了 53%,在基本无法解决的任务上获得了 0 到 1 的增益,同时保留了基本的广泛功能。 PPS outperforms LoRA 微调, from-scratch specialists, residual policies, and prior inference-time steering methods.