论文
具有基础模型对齐的生成事件预训练
Generative Event Pretraining with Foundation Model Alignment
摘要
事件摄像机凭借其微秒延迟和高动态范围,可以在快速运动和具有挑战性的照明条件下提供强大的视觉信号。然而,它们独特的传感特性和有限的标记数据使得训练基于事件的视觉基础模型(VFM)变得具有挑战性,而这对于学习可跨任务转移的视觉特征至关重要。为了解决这个问题,我们提出了 GEP(生成事件预训练),这是一个两阶段框架,它将从互联网规模图像数据集中学习的语义知识转移到事件数据,同时学习特定于事件的时间动态。首先,事件编码器通过联合回归对比目标与冻结的 VFM 对齐,以图像语义中的事件特征为基础。其次,Transformer 主干网在混合事件图像序列上进行自回归预训练,以捕获事件特有的时间结构。我们的方法在各种下游任务上都优于最先进的事件预训练方法,包括对象识别、分割和深度估计。 VFM 引导的对齐和生成序列建模共同产生了语义丰富、时间感知的事件模型,可以跨领域稳健地推广。