论文

LUT:视觉推理的潜在效用训练

LUT: Latent Utility Training for Visual Reasoning

模型训练强化学习

摘要

多模态 大语言模型 具有先进的视觉理解能力,但感知密集型推理仍然具有挑战性。最近的潜在视觉推理方法在回答之前引入了隐藏空间计算,但它们通常依赖于昂贵的中间监督,例如边界框、草图或交错的基本原理。这些策略侧重于如何塑造潜在状态,但没有明确评估潜在状态是否对最终答案有用。我们提出了 LUT,一种仅使用标准 VQA 对进行训练的潜在推理框架。 LUT 将潜在效用训练集中在两个层面。在轨迹层面,我们提出了Utility-Aware Latent 蒸馏 SFT,它探索与答案相关的潜在轨迹,通过信息增益选择合格的轨迹,并通过课程学习提炼出更可靠和可学习的监督。在步骤级别,我们提出了潜在归因策略优化,它使用潜在归因答案来差异化优化强化学习期间的潜在步骤。感知密集型视觉推理基准的实验表明,LUT 优于以前的潜在推理方法,并且与具有较低注释成本的潜在文本交错方法保持竞争力。