论文

FAST:流动任何场景Transformer

FAST: Flow Any Scene Transformer

模型架构Transformer

摘要

缩放已成为语言和视觉基础模型进步的主要驱动力,但其在精确对应匹配中的作用仍未得到充分探索。在这项工作中,我们提出了 Flow Any Scene Transformer (FAST),这是一种由两个关键见解驱动的可扩展对应模型。首先,我们揭示了单视图视觉基础模型内的查询键投影编码了一个粗略但可重用的先验,用于跨视图匹配。其次,以交叉注意力形式重用这些预训练的投影可以为从单视图编码器构建的基于 ViT 的匹配器产生高效的初始化。在这些见解的指导下,我们在普通的单视图基础模型上构建了 FAST,利用零参数重新布线策略将选定的自注意力层转换为跨视图交互的交叉注意力。这种设计允许基于 ViT 的匹配器随着单视图基础模型的进步而扩展,从而无需专门的以对为中心的预训练阶段。为了充分释放该公式的扩展潜力,我们组装了 600 万对训练语料库,用于跨不同共同可见图像对的通用密集二维位移估计。大量实验表明,FAST 在各种基准测试中都实现了最先进的性能,同时可根据骨干规模和训练数据进行良好的扩展。