论文
CriticHack视觉奖励黑客
CriticHack: Evaluating Visual Rewards Under Robot Policy Optimization
摘要
学习型视觉奖励模型越来越多地用于优化机器人策略,但奖励模型可能给作用于错误对象的执行打出与完成任务同样高的分。我们展示优化这类奖励会在奖励与任务成功率双双上升的同时放大错对象失败,使从业者通常监控的信号看起来健康。我们在抽屉任务上对扩散策略的全部去噪器参数针对Robometer微调:从无奖励暴露的监督策略出发,五次训练使512个评估种子上的任务成功率上升10.2个百分点,错对象失败上升10.9点;而用模拟器任务完成信号训练的五次运行提升成功率却不放大错对象失败(差9.2点,95% CI 5.6至13.0)。这种放大从先前针对学习型奖励优化过的策略复发,在策略原生扩散采样器下、在与初始策略等距处、以及在两个批评家与两个优化器的受限策略实验中均复现。一个倾斜模型解释了何时发生:在KL正则优化下,只要某结果在初始策略下的期望奖励超过总体平均,它就更频繁出现。Robometer总体上能区分成败(AUROC .81),但给错对象失败的打分略高于成功(AUROC .37),因此优化使两者同升。同一模型预测26个受限设置中的结果偏移(Spearman .89),包括任务成功率下降的情形;Robometer自己发布的成功终止配方继承了这一错误。一个冻结的结果校验器把同样的优化重新导向被请求的任务。