论文
LIME:从以自我为中心的视频中学习意图感知的相机运动
LIME: Learning Intent-aware Camera Motion from Egocentric Video
摘要
自主机器人通常需要移动相机才能采取行动:检查物体、显示被遮挡的区域或获取响应用户意图的视图。虽然视觉语言导航将指令转换为基本运动,而视觉语言动作策略将指令映射为操纵动作,但语言条件相机运动作为一流动作的探索相对较少。我们制定了语言条件相机运动生成:给定当前的 RGB 观察和自由形式的自然语言意图,预测下一个观察的相对目标相机姿势。这项任务本质上并不简单:视点变化是由潜在的感知意图驱动的,有效的运动可以在不同的语义粒度上运行,从进入房间到环顾角落,检查可见物体,或揭示被遮挡的细节。为了模拟这种结构,我们从以自我为中心的视频中挖掘多意图相机运动监督,将合理的意图和观察增益描述与相对 SE(3) 目标姿势配对。我们提出了 LIME,一种视觉语言相机运动生成器,它将自回归观察增益输出与连续流匹配姿势头相结合。这种设计让模型在表示多假设目标视图时共同预测下一个视图应显示的内容。在实验和下游机器人任务中,我们表明 LIME 可以学习从被动人类视频中主动选择相机姿势,将普通的以自我为中心的记录转变为对意图感知的主动感知的监督。