论文
用于鲁棒多模式电子商务推荐的文本引导视觉表示学习
Text-Guided Visual Representation Learning for Robust Multimodal E-Commerce Recommendation
摘要
多模式项目嵌入对于电子商务项目到项目 (I2I) 检索至关重要,但现实世界的产品图像通常包含促销叠加和背景杂乱,这些会注入虚假的视觉线索并降低检索的鲁棒性。这个问题在 MLRM 式管道中尤其明显,其中冻结视觉编码器通过轻量级连接器连接到 LLM,该连接器必须有选择地聚合视觉标记。我们提出了文本引导 Q-Former (TGQ-Former),这是一种文本引导的视觉表示学习框架,它利用结构化元数据作为视觉标记提取的语义指导,同时保留补充的视觉证据。具体来说,TGQ-Former 采用混合查询连接器来解开元数据锚定和探索性视觉流,并引入轻量级可靠性感知双门矢量调制模块来自适应校准它们在噪声输入下的贡献。通过全池检索对大规模真实电子商务数据集进行的实验表明,TGQ-Former 始终优于强大的连接器基线和端到端 MLLM。平均而言,它将 Hit Rate@100 (H@100) 提高了 6.04%,证明了文本引导视觉编码对于鲁棒多模态检索的有效性。