论文
行为克隆:将模式重定向提炼为策略权重,无需推理时间引导
Behavior Uncloning: Distilling Mode Redirection into Policy Weights without Inference-Time Steering
摘要
行为克隆策略通常从演示数据集中学习多种行为模式,包括不安全或部署时不需要的模式。例如,经过各种交接示范训练的政策可能会学会先传递刀刃。数据管理和推理时间指导等标准补救措施要么需要访问原始演示以进行全面的再训练,要么会增加大量的推理时间开销。为了解决这一差距,我们提出了 MoRE(模式重定向),它通过一个简短的“非克隆”步骤将策略执行轨迹重定向到所需的行为模式。具体来说,MoRE 将来自临时模式分类器的重定向信号提取为策略权重以引导行为。保留损失通过保留所需模式能力来平衡此编辑,允许独立策略以零推理时间开销抑制不需要的模式。在 8 个模拟和现实任务中,MoRE 的平均部署成功率 (SR) 比原始混合模式策略提高了 44 个百分点。在所有比较的适应和转向基线中,MoRE 实现了最强的 SR 并接近过滤数据再训练参考,同时保持任务能力和推理速度。 MoRE 还概括了机器人策略主干,包括扩散策略和 Pi0.5 VLA、不同的任务类别和实际部署。