论文

CoLVR:通过对比优化增强探索性潜在视觉推理

CoLVR: Enhancing Exploratory Latent Visual Reasoning via Contrastive Optimization

模型训练强化学习

摘要

由于潜在视觉推理具有探索性推理的潜力,最近的工作倾向于使 MLLM(多模态 大语言模型)通过传播连续隐藏状态而不是将中间步骤解码为离散标记来执行视觉推理。然而,现有的工作通常依赖于硬对齐目标来强制潜在表示与预定义的视觉特征相匹配,从而严重限制了潜在推理过程的探索。为了解决这个问题,我们提出了CoLVR(潜在视觉推理的对比优化)。为了获得更具探索性的视觉推理,CoLVR 引入了潜在对比训练框架。首先,CoLVR 通过基于角度的扰动引导的潜在对比目标学习多样化的探索性表示,这扩展了语义潜在空间并避免了过度约束的嵌入。然后,CoLVR 采用 RL(强化学习)后训练 的潜在轨迹对比奖励来实现潜在视觉推理过程的细粒度优化,从而促进多样化的推理行为。实验表明,CoLVR 显着增强了潜在表示的探索能力,在 VSP 上平均提高了 5.83%,在 Jigsaw 上平均提高了 8.00%,同时在域外基准上也优于现有潜在模型,在 MMStar 上提高了 3.40%。数据、代码和模型发布于https://github.com/Oscar-dzy/CoLVR。