论文

双线性流策略:目标条件视觉运动模仿的分布外推

Bilinear Flow Policy: Distributional Extrapolation for Goal-Conditioned Visuomotor Imitation

模型推理解码与生成控制

摘要

具有流匹配的目标条件模仿学习(GCIL)是一个有前途的框架,它可以表示多模式行为,同时适应不同的、用户指定的目标,但当目标超出演示支持范围时通常会失败。为了在不破坏多模态的情况下推断出这些看不见的目标(我们称之为分布外推的问题),我们引入了双线性流策略 (BFP),这是一种将转导检索与双线性条件流相结合的生成视觉运动策略。给定一个看不见的观察目标对,BFP 检索一个“锚”训练示例,并以转导方式将看不见的对重新表述为这个熟悉的锚加上一个残差项。为了通过这种分解来指导动作预测,残差必须紧凑地编码当前观察目标对与锚点的差异,并且必须选择锚点,以便这种差异可以预测相应的动作分布。 BFP 通过预训练的视觉特征和新颖的学习锚点选择算法来实现这一点。然后,新颖的双线性流对锚点和残差如何共同确定多模态动作分布进行建模。我们证明,对于适当假设下的双线性流,未见目标的动作分布误差受到分布内流匹配误差直至问题相关因素的限制。在模拟中的五个操作任务中,BFP 的分布外成功率是 GCIL 策略的 2.63 倍,是最强外推目标基线的 1.36 倍。在两项现实任务中,BFP 比 GCIL 提高了 32%。最后,我们的理论产生了实用的预部署诊断,用于预测哪些经过训练的策略将很好地推断以及达到哪些看不见的目标。

双线性流策略:目标条件视觉运动模仿的分布外推的原论文方法或结果图
图 1:BFP 概述。 BFP 了解观察目标条件的变化如何影响行为,并重新利用这种关系从已证明的锚点推断出未见过的目标。双线性条件流生成最终的多模态动作分布,而显式外推规则可实现理论保证和实际诊断。