论文

用于人机视觉适应的帧级时间对齐

Frame-Level Temporal Alignment for Human-to-Robot Visual Adaptation

摘要

将人类视频上预训练的视觉表示转移到机器人操作需要学习人类和机器人演示之间的可靠对应关系。但是,配对演示的执行速度和不直接反映任务进度的非关键帧的比例可能有所不同。因此,具有相同相对时间戳的帧可能代表不同的任务阶段,这可能导致对应学习失败。为了解决这些问题,我们提出了帧级时间对齐(FLTA),该框架使用两个时间先验来调整在人类视频上预训练的视觉编码器以进行机器人操作。它学习共享的任务进度表示,无需帧级对应注释,从而允许不同相对时间位置的帧进行匹配。全局进展先验将归一化的时间位置与视觉相似性结合起来,构建软对应目标。局部时间顺序先验会惩罚向后转换,同时允许停留和改变向前速率以适应执行速率差异。使用 ResNet-50 和 ViT 编码器,我们的方法在平均模拟成功率方面相对于最佳基线分别实现了 46.93% 和 65.96% 的相对改进,并在现实世界的操作任务中实现了更高的任务成功率率。这些结果还表明,有效的人机适应更多地取决于选择的参数,而不是更新的参数数量。我们的项目页面位于 https://rtx5090ultra.github.io/FLTA-Project-Page/.

用于人机视觉适应的帧级时间对齐的原论文方法或结果图
图 1:从视频级到帧级对齐。视频级对齐使人类和机器人的视频表示更加接近,而无需明确建立帧级对应关系。执行率和非关键帧比例的差异意味着在相同相对时间采样的帧可能显示不同的任务阶段。我们的方法通过学习跨域帧对应来解决这些时间差异,而不需要帧级注释。