论文
UniCA:具有正相似性损失的双向交叉注意力,用于稳健的多模态检索
UniCA: Bi-directional Cross-Attention with Positive Similarity Loss for Robust Multi-Modal Retrieval
摘要
多模态检索对于处理现实应用中不断增长的集成视觉文本数据变得越来越重要,但现有框架依赖于通过文本编码器自注意力的隐式融合,限制了显式的跨模态语义对齐。为了解决这一差距,本文提出了 UniCA(统一交叉注意力编码器),这是一种多模态检索模型,具有四个关键创新:1)双向交叉注意力(Bi-CA)块,可以在连接之前实现视觉和文本标记之间的主动语义交换,从而更有效地捕获模态间相关性。 2)积极相似性损失,优化查询和积极候选嵌入之间的绝对语义接近度。 3)简化的数据集UMR-S10(通用多模态检索样本10%),以减少计算成本,同时保留语义多样性和任务代表性。 4) WebQA 基准测试的实验验证表明,UniCA 在混合任务和图像文本任务中优于基线模型,混合任务的 Recall@5 提高了 4.09%,Recall@10 提高了 3.28%,MRR@1 提高了 3.96%。 UniCA 为多模态检索提供了高效、稳健的解决方案,通过其轻量级数据集和增强的融合机制降低了部署障碍。