论文

多模态推荐的潜在对齐推理

Latent-Aligned Reasoning for Multimodal Recommendation

模型训练监督微调与指令调优

摘要

多模态视觉语言模型(VLM)在跨模态理解方面表现出了卓越的能力,但将其应用于推荐时仍然存在一个基本挑战:随着表征通过多步推理传播,视觉和文本信号逐渐减弱——我们将这种现象称为跨模态稀释。为了解决这个问题,我们提出了 LARK(潜在对齐推理框架),这是一个两阶段潜在推理框架,在单个 VLM 内具有互补的对齐机制。在第一阶段,可学习的潜在标记与多步骤思想链(CoT)推理交织在一起,并与冻结视觉编码器明确对齐,充当视觉检查点,在整个推理链中保留感知细节。在第二阶段,通过桥 MLP 投射潜在表征,并通过项目到项目的对比学习进行训练;为了防止推理语义消失,中间特征与第一阶段的 CoT 隐藏状态对齐,将最终嵌入锚定到模型自己的推理输出。对三个公共基准和一个工业数据集的实验表明,LARK 在多个推荐架构中实现了最先进的性能,并通过受控消融确认了每个组件的独特贡献。