论文

OpticalRec:用于多模态推荐的统一光学视觉语言表示

OpticalRec: Unified Optical Vision-Language Representation for Multimodal Recommendation

应用与实践结构化分析、预测与决策

摘要

视觉语言建模的最新进展极大地改进了多模态编码、检索和推理。然而,对于多模态推荐,编码丰富的项目视觉语言语义交互仍然是一个长期存在的瓶颈,这阻碍了准确的项目表示学习和用户项目匹配。主流方法主要采用视觉和语言模态的独立编码,然后是严格的后期融合,例如串联,固有地省略本机视觉-语言交互并引入跨模态语义失真。为了应对这一挑战,我们提出了 OpticalRec,这是第一个用于多模态协同过滤的视觉空间统一编码范例,这是一种基本的推荐设置。 OpticalRec 不是孤立的特定模态编码,而是将项目文本元数据呈现为视觉字形,从而在视觉编码器(感知编码级别)内实现本机图像文本交互。由此产生的表示由语言解码器(语义编码级别)进一步处理,使 OpticalRec 能够利用现代视觉语言模型的双重注意机制,而以前的编码方法忽略了这一点。 OpticalRec 的功效在理论上得到了互信息分析的支持,并通过跨强大基线和基准的卓越性能得到了实证证明。作为即插即用模块,OpticalRec (1) 成本最低,(2) 对渲染文本字体、颜色和布局等具有鲁棒性,(3) 无缝集成到现有的多模式协同过滤模型中。

OpticalRec:用于多模态推荐的统一光学视觉语言表示的原论文方法或结果图
图 1:(a) 传统独立编码与后期融合、(b) 基于提示的VLM编码和 (c) OpticalRec 的比较。 (a) 独立编码图像和文本,在有损且严格的后期融合步骤之前不允许跨模式交互。 (b) 还分别对两种模态进行编码,但在语言解码器中引入语义级交互。 (c) OpticalRec 在统一的视觉空间中联合编码图像和文本,从而实现 1. 视觉编码器中的补丁/感知级交互和 2. 语言解码器中的映射token/语义级交互。我们将整个视觉语言模型(视觉编码器、投影仪、语言解码器)视为一个集成的VLM编码器,遵循QwenVL和InternVL等主流架构。所有编码器和VLM都是冻结/训练免费的,以提高计算效率。