论文
重新思考机器人模仿学习中的示范忘却
Rethinking Demonstration Unlearning in Imitation Learning for Robotics
摘要
机器人的模仿学习依赖于人类的示范,其中一些示范后来人们可能会要求删除。没有它们的再训练是自然的参考,但其成本随着策略和数据集规模的增加而增加,从而激励更便宜的操作员编辑经过训练的策略。从机器遗忘中继承的指标,例如遗忘丢失或单个成员资格攻击,并不能确定编辑从闭环中作用的策略中删除了什么。因此,我们引入了一种重新训练校准的审计,它沿着两个轴读取演示的遗忘:行为,编辑后的策略是否像没有删除演示的情况下重新训练的策略一样,以及证据,审计员是否仍然可以检测到它已接受过训练。行为轴衡量匹配状态下重新训练的动作差异,并通过独立重新训练构建的底层进行校准,因此该底层的策略与重新训练的接近程度与重新训练之间的接近程度一样。证据轴对重新训练空值应用每次演示成员资格攻击,报告其排名及其绝对成员损失水平,因为排名本身接受将成员损失夸大到超过空值的运算符。然后,保形测试将两个轴组合成一个联合再训练一致性的假设,反对一组足够大的独立再训练,以在常规意义上拒绝。在三个真实机器人策略类和两个模拟套件的五个预注册条件中,轴在一个检查点上双向分离,因为编辑可能会修复任务行为,同时保持证据不变,或者减少证据,同时使行为远离再训练。在 ACT 手臂上,重定向编辑将盲评分机器人的成功恢复到 20 次试验中的 18 次。