论文
PrefPI:偏好引导的分布外行为引导
PrefPI: Preference-Guided Steering into Out-of-Distribution Behaviors
摘要
我们提出了 PrefPI(偏好引导策略迭代),这是一种迭代框架,用于仅使用相对于自生成轨迹的相对偏好来引导预训练的生成机器人策略。与先前主要强化政策已经代表的模式的偏好学习方法不同,我们研究超出初始有效支持的指导,其中在初始政策下很少或从未观察到期望的行为。我们的关键思想是将偏好学习制定为偏好条件生成模型:偏好轨迹定义条件分布,其与更广泛行为先验的密度比提供了由无分类器指导(CFG)放大的隐式偏好信号。重复这种以偏好为条件的建模和指导步骤会产生一种偏好引导的策略迭代形式,从而将增量改进转向以前无法实现的行为。跨越模拟和现实世界中的扩散策略和 PI0.5 流量匹配 VLA,PrefPI 会在有限的反馈下产生实质性的行为转变。特别是,PrefPI 在仅具有 150 个偏好标记轨迹的真实硬件上将对象传输高度从 10.7 厘米增加到 19.8 厘米。