论文
预测,然后检索:从视频前缀进行跨实例未来状态检索
Predict, Then Retrieve: Cross-Instance Future-State Retrieval from Video Prefixes
摘要
我们引入了预测状态检索(PSR),这是一项模型观察短视频前缀和有关对象未来状态的时间问题的任务,然后从描述该状态的其他视频或图像中检索实例。与预测标签的动作预期、定位视频中观察到的事件的时刻检索或合成像素的视频生成不同,PSR 将预期与跨多个时间范围的跨实例检索相结合。我们根据四个数据集构建了一个基准,其中包含经过分级、人工验证的 真值、难度等级和预言机上限。我们还提出了 LFTR,一种带有冻结编码器的轻量级 检索器,它可以预测问题和视野条件下的未来潜在变量,并在互补的语义和视觉空间中进行匹配。上限分解揭示了一个明显的瓶颈:一旦指定,真实的未来状态是高度可检索的,而我们评估的每个预测器,包括可以访问前缀框架的大型多模态语言模型,仍然远远低于预言机。因此,预测而不是感知是可学习的核心挑战。 LFTR 以大幅降低的推理成本缩小了这一差距,并且消融将其收益归因于跨空间融合和硬负训练,而不是潜空间预测轨迹。我们发布了基准测试、代码和评估脚本。