论文

文本中的混乱:揭示混合模态检索器的模态偏好

Chaos in the Text: Revealing the Modality Preference in Mixed-Modality Retrievers

模型评测模型训练应用与实践预训练鲁棒性、公平性与可信度评测搜索

摘要

密集检索器在文本和图像语料库方面取得了重大进展,但这些功能是否可靠地扩展到包含文本、图像和融合文本图像文档的混合语料库仍不清楚。在本文中,我们系统地检查了跨架构的检索器,发现它们的性能对模态组成高度敏感。随着图像文档逐渐被语义对应的文本表示所取代,检索性能遵循明显的 V 形曲线,在单模态语料库上保持强劲,但在模态共存时大幅下降。特别是,不相关的文本比相同数量的不相关的图像导致更严重的退化,我们将这种现象称为文本中的混沌。进一步的分析揭示了模态偏好,即文本表示系统地获得更高的相似性分数,从而使不相关的文本超越相关图像。为了减轻这种偏差,我们引入了 Trident,它将每个文档的文本、图像和融合的文本图像视图构建为同等正值,并联合 通过 Multi-Positive View InfoNCE 优化相关性辨别和正面视图平衡。跨视觉文档和自然图像基准的实验表明,trident 改进了基于 CLIP 和基于 VLM 架构的混合模态检索,降低了对模态组成和文本干扰的敏感度,并提高了平均单模态检索性能。