论文
战略性地扩大规模:通过机器人操作的偏差感知评估和数据收集来学习组合概括
Scale Up Strategically: Learning Compositional Generalization via Bias-Aware Evaluation and Data Collection for Robotic Manipulation
摘要
组合概括对于机器人遵循不同的指令至关重要。然而,众所周知,预先训练的政策会走捷径,遵循显着的线索而不是基础语言。我们引入了一个诊断框架,将这种失败定位到各个 \textit{指令因素},\textit{例如} 可重用的语义组件,例如颜色、动词、对象、大小和空间属性。我们的框架形式化了指令因子偏差,即微调政策过度依赖主导因素作为捷径的倾向,并通过两个指标对其进行量化:因子主导率(FDR),捕获因子之间的成对偏差,以及因子主导层次(FDH),将它们汇总到全球排名中。对六项基础政策的评估揭示了大致一致的顺序,\textit{i.e.},颜色$\geq$对象$\geq$空间$\geq$动词$\geq$大小,其中颜色占主导地位,动词和大小最底层。我们进一步表明诊断是可行的:一种偏见感知数据收集策略,将固定预算重新分配给地下因素,在模拟和使用一半演示的真实机器人上优于基线,从而实现更有效的样本和更普遍的政策学习。