论文

PHA-Net:用于文本视频检索的基于原型的分层对齐网络

PHA-Net: Prototype-based Hierarchical Alignment Network for Text-Video Retrieval

摘要

随着大规模图像文本 预训练 模型(例如 CLIP)的出现,文本视频检索近年来取得了长足的进步。现有的性能最佳的方法涉及同时在个体、局部和全局层面上调整跨模态语义,这引起了人们对简洁文本和丰富视频之间内在语义不匹配的担忧。一种规范的方法是将多个语言视频注意力模块集成到分层框架中,而这种范例仅以高昂的计算成本优化视觉表示。在本文中,我们提出了一种新的基于原型的分层对齐网络(PHA-Net)来跨模态对齐个体/局部/全局级别的表示。具体来说,我们引入了多个模态共享原型作为桥梁,以有效优化文本和视频表示以实现跨模态对齐。然后,我们认为集群词元中不平衡的语义分布可能会损害检索性能,因为语义较弱的词元没有什么意义。为了减少这些词元的影响,提出了一个支持原型的词元合并模块,负责通过原型语义指导增强具有强语义的词元并抑制其他具有弱语义的词元。此外,我们设计了一种原型对比损失,以鼓励文本和视觉原型关注不同的语义信息。这种辅助损失的想法是确保来自同一原型的文本和视觉原型之间的相似性高于来自不同原型的文本和视觉原型。对四个基准的大量实验证实了我们的 PHA-Net 的有效性,它在 MSR-VTT (8.8%)、ActivityNet (19.2%)、VATEX (0.7%) 和 Charades (4.9%) 的所有召回率总和上取得了显着的改进。代码可在 https://github.com/JingXiaolun/PHA-Net 获取。