论文
使用线性上下文学习器来呈现动态 3D 场景中的像素
Featurising Pixels from Dynamic 3D Scenes with Linear In-Context Learners
摘要
视觉模型最令人兴奋的应用之一涉及像素级推理。尽管视觉基础模型丰富,但我们仍然缺乏在像素级别有效嵌入视觉场景时空属性的表示。现有框架要么在基于图像的借口任务上进行训练,这些任务不考虑动态元素,要么在视频序列上进行动作级推理,而这不会扩展到密集的像素级预测。我们提出了一个从视频中学习像素精确特征描述符的框架 LILA。我们的训练框架的核心要素是线性情境学习。 LILA 利用时空线索图(深度和运动),通过现成的网络进行估计。尽管这些线索具有嘈杂的性质,LILA 仍然可以在未经整理的视频数据集上进行有效的训练,以时间一致的方式嵌入语义和几何属性。我们在一系列不同的视觉任务中展示了学习表示的令人信服的经验优势:视频对象分割、表面法线估计和语义分割。