论文
MSGAT:用于图像文本检索的具有相似性空间融合的多头尖峰图注意力
MSGAT: Multi-Head Spiking Graph Attention with Similarity-Space Fusion for Image-Text Retrieval
摘要
尖峰神经网络(SNN)通过稀疏事件驱动计算提供节能计算范式,显示出高效多模态学习的巨大潜力。然而,将 SNN 应用于高级多模态任务(例如图像文本检索 (ITR))仍然具有挑战性,因为稀疏尖峰表示使得很难捕获跨模态对齐所需的语义结构。现有的尖峰 ITR 方法依赖于训练期间的局部对齐和额外的软标签监督,同时缺乏对结构和多粒度关系的认识。为了解决这些问题,我们提出了一种用于结构建模的多头尖峰图注意力网络(\textbf{MSGAT}),并为其配备动态注意力头以捕获互补的关系模式并实现尖峰驱动的图推理和聚合。然而,在两分支多粒度融合框架内,MSGAT生成的细粒度尖峰表示是稀疏且离散的,而全局表示是连续的,使得传统的特征级融合 容易受到异构表示的干扰。因此,我们引入了 \textbf{Sim-Fuse},一种集成粗粒度和细粒度匹配关系的相似空间融合对齐策略,同时避免异构表示的直接融合。在 Flickr30K 和 MSCOCO 上的实验表明,我们的方法在匹配设置和现有 SNN 检索基线下优于 ANN 方法。此外,只需两个时间步长,我们的 SNN 就可以实现与 ANN 对应物相当或更好的性能,同时将理论模块级能量降低 55%。该代码在补充材料中提供。