论文

实现稳健的文本到图像人物检索:语义补偿的多视图重构

Towards Robust Text-to-Image Person Retrieval: Multi-View Reformulation for Semantic Compensation

摘要

在文本到图像的人物检索任务中,自然语言表达的多样性和视觉语义的隐含性常常导致表达漂移问题,其中语义等效的文本由于短语变化而在嵌入空间中表现出显着的特征差异,从而降低了图像文本对齐的鲁棒性。本文提出了一种由大语言模型(LLM)驱动的语义补偿框架(MVR),通过多视图语义重构和特征补偿来增强跨模态表示一致性。核心方法包括三个部分: 多视图重构(MVR):双分支提示策略结合了关键特征指导(通过特征相似性提取视觉关键组件)和多样性感知重写,以生成语义等效但分布多样的文本变体;文本特征鲁棒性增强:无需训练潜在空间补偿机制通过多视图特征均值池和残差连接抑制噪声干扰,有效捕获“语义回声”;视觉语义补偿:VLM 生成多视角图像描述,并通过共享文本重新表述进一步增强,以解决视觉语义差距。实验表明,我们的方法无需训练即可很好地提高原始模型的准确性,并在三个文本到图像的人物检索数据集上执行 SOTA。