论文
OpticalRec:用于多模态推荐的统一光学视觉语言表示
OpticalRec: Unified Optical Vision-Language Representation for Multimodal Recommendation
摘要
视觉语言建模的最新进展极大地改进了多模态编码、检索和推理。然而,对于多模态推荐,编码丰富的项目视觉语言语义交互仍然是一个长期存在的瓶颈,这阻碍了准确的项目表示学习和用户项目匹配。主流方法主要采用视觉和语言模态的独立编码,然后是严格的后期融合,例如串联,固有地省略本机视觉-语言交互并引入跨模态语义失真。为了应对这一挑战,我们提出了 OpticalRec,这是第一个用于多模态协同过滤的视觉空间统一编码范例,这是一种基本的推荐设置。 OpticalRec 不是孤立的特定模态编码,而是将项目文本元数据呈现为视觉字形,从而在视觉编码器(感知编码级别)内实现本机图像文本交互。由此产生的表示由语言解码器(语义编码级别)进一步处理,使 OpticalRec 能够利用现代视觉语言模型的双重注意机制,而以前的编码方法忽略了这一点。 OpticalRec 的功效在理论上得到了互信息分析的支持,并通过跨强大基线和基准的卓越性能得到了实证证明。作为即插即用模块,OpticalRec (1) 成本最低,(2) 对渲染文本字体、颜色和布局等具有鲁棒性,(3) 无缝集成到现有的多模式协同过滤模型中。
