论文

针对性模态屏蔽增强机器人对视觉中断的适应能力

Targeted Modality Dropout for Real-Robot Manipulation Robust to Intermittent Vision Loss

模型训练模型评测应用与实践监督微调与指令调优鲁棒性、公平性与可信度评测机器人

摘要

整合多种感觉模态的模仿学习策略在训练过程中很容易过度依赖视觉等主导模态,当该模态在推理时丢失时,这可能会扰乱策略的执行。在本文中,我们引入了目标模态丢弃(TMD),其中使用注意力来估计对每种模态的依赖性,并有选择地丢弃最主要的模态。这与依赖分布的熵正则化相结合。通过使用双手操纵器进行真实机器人评估,我们发现,在视力丧失的情况下,基线策略的成功率大幅下降,而 TMD 却能维持任务执行。相比之下,在没有熵正则化的情况下随机选择丢弃模态的传统 dropout,即使没有视力损失,也无法完成许多任务。

针对性模态屏蔽增强机器人对视觉中断的适应能力:论文原图
图 2:训练期间所提出方法的概述。语言和视觉Token由冻结的预训练编码器编码,并由可训练适配器集成,而状态Token则直接投影和连接,以便动作专家的键/值记忆包含所有三种模式的Token。因为适配器涉及语言和视觉标记,所以它的每个输出标记都携带来自这两种标记的信息,因此对这两种模式的依赖不是在完全独立的表示上衡量的。依赖性 ptp_{t} 驱动两种机制:mt−1†m^{\dagger}_{t-1} 的标记在样本子集中归零,并且 ptp_{t} 的熵进入损失。在此处绘制的步骤中,视觉是目标,因此其标记行呈阴影且其标记呈灰色。有关操作顺序,请参阅算法 1。