论文

AFMRL:电子商务中的属性增强细粒度多模态表示学习

AFMRL: Attribute-Enhanced Fine-Grained Multi-Modal Representation Learning in E-commerce

应用与实践行业应用

摘要

多模态表示对于相同产品检索等电子商务任务至关重要。大型表示模型(例如 VLM2Vec)表现出强大的多模态理解能力,但它们难以实现细粒度的语义理解,而这对于区分高度相似的项目至关重要。为了解决这个问题,我们提出了属性增强细粒度多模态表示学习(AFMRL),它将产品细粒度理解定义为属性生成任务。它利用多模态 大语言模型 (MLLM) 的生成能力从产品图像和文本中提取关键属性,并通过两阶段训练框架增强表示学习:1) 属性引导对比学习 (AGCL),其中 MLLM 生成的关键属性用于图像文本对比学习训练过程中,以识别硬样本并过滤掉噪声假阴性。 2)检索感知属性强化(RAR),其中表示模型属性集成后检索性能的改进作为奖励信号,以增强多模态 微调 期间 MLLM 的属性生成。对大规模电子商务数据集的大量实验表明,我们的方法在多个下游检索任务上实现了最先进的性能,验证了利用生成模型推进细粒度表示学习的有效性。