论文
审核多模式机器人演示中的指令轨迹不匹配
Auditing Instruction-Trajectory Mismatches in Multimodal Robot Demonstrations
摘要
用于训练视觉-语言-动作策略的机器人演示数据集可能包含一种微妙但有害的失败模式:行为正确但与错误的语言指令配对的轨迹。我们研究了这些指令轨迹不匹配(ITM)的事后审计。与失败的执行轨迹不同,ITM 通常看起来似乎合理,并且可能会破坏策略学到的语言行为映射。我们提出了多模态概率融合(MMPF),这是一个 无需训练 审核框架,它将每种模态视为专家,根据局部邻域协议和全局原型相似性估计任务标签分布,然后将模态与专家产品中的预测熵权重融合。在具有注入指令不匹配和嘈杂的真实机器人数据的 LIBERO 基准测试中,MMPF 实现了最强的整体 ITM 检测和标签校正精度。我们还表明,在需要语言来消除任务歧义的情况下,审计可以改善大多数下游政策学习。我们在真实的机器人实验中证明,我们的方法可以实现改进的策略性能,并展示过滤演示与重新标记相比的权衡。