论文

Hyper-RED:通过语义超图蒸馏进行可扩展事件预训练

Hyper-RED: Scalable Event Pre-training via Semantic Hypergraph Distillation

摘要

事件摄像机在强大的视觉感知方面表现出了巨大的潜力,但由于大规模带注释的事件数据的稀缺,扩展事件表示学习仍然具有挑战性。预训练的图像模型提供可扩展的语义监督,但现有的图像到事件方法依赖于严格的像素方式或标记方式对齐,忽略了纹理、密度和外观的模态差异,可能导致语义崩溃并限制可转移性。为了解决这个问题,我们提出了 Hyper-RED,这是一种简单、无痛且可扩展的图像到事件预训练框架,可将高阶语义结构从图像传输到事件。 Hyper-RED 使用超图来建模和对齐多个图像和事件标记之间的高阶语义关联,从而实现跨模态知识转移,同时适应模态特定的差异,而不是强制执行严格的一对一对应。具体来说,给定配对的事件-图像样本,Hyper-RED 利用 DINOv3 提取空间标记表示并构建图像、事件和跨模式语义超图,其中每个超边连接多个语义相关的标记。我们进一步引入了一种超图关系蒸馏损失,它施加互补的模内和跨模态约束,使事件编码器能够继承图像派生的语义组织,同时保留局部关系一致性和事件特定的特征。对五个事件数据集的三个任务进行的实验证明了从 ViT-S 到 ViT-L 的一致扩展以及最先进的性能(图 1)。代码位于:https://github.com/meisenwang/Hyper--RED。