论文

记忆、适应、忽略:训练数据变化下诊断机器人学习机制

Memorize, Adapt, Ignore: Diagnosing Robot Learning Mechanisms under Training Data Variation

模型评测模型行为与机制分析

摘要

训练数据的变化,无论是通过在模拟中设计域随机化(DR)方案还是策划模仿学习的演示,都是提高机器人操纵策略鲁棒性的主要杠杆。然而其潜在机制仍然知之甚少,从业者通常通过昂贵的试验和错误来选择随机化参数。我们通过一系列案例研究来研究这些机制,随机化对象大小、颜色和类型以及场景照明和语言提示,包括 ManiSkill 中的拾取和放置 RL 以及 LIBERO 和 RoboTwin 上视觉语言动作 (VLA) 模型的微调。我们使用经验神经切线核(NTK)作为我们的主要诊断工具来检查模型行为和内部表示。我们表明,NTK 区分了内部学习机制的转变,从 记忆 变化不足的不同情况(例如,\ 学习如何处理大立方体,以及如何处理小立方体)到 适应 具有足够变化的当前情况。基于 NTK 的信噪比还有助于区分策略何时学会忽略与任务无关的因素(例如\相同地处理蓝色和红色立方体,而不是学习蓝色子策略和红色子策略)。我们使用这些诊断来开发设计灾难恢复方案、选择模型和检测捷径学习的实用指南。我们进一步比较不同类型的表示,并使用基于 ACT 的模仿学习通过现实世界的硬件实验验证我们的发现。