论文
ReGuLaR:大型视觉语言模型的基于关系的潜在推理
ReGuLaR: Relation-Grounded Latent Reasoning for Large Vision-Language Models
摘要
思想链(CoT)推理通过用自然语言描述中间推理步骤,显着提高了大型视觉语言模型(LVLM)的推理能力。然而,这种离散的文本原理通常不足以编码连续的视觉证据。最近的工作通过将推理转移到连续的潜在空间来解决这一限制。尽管取得了有希望的进展,但现有方法使潜在推理与视觉证据的组成和关系结构的联系不够充分。为了解决这一差距,我们引入了 ReGuLaR,这是一个基于关系的潜在推理框架,它明确地将这些关键但被忽视的视觉证据中的潜在状态建立起来。 ReGuLaR 使用训练时 ReGFormer 将潜在推理集中在与问题相关的对象和对象间关系上,而在推理时,模型在不调用 ReGFormer 的情况下进行推理并生成答案。为了支持训练 ReGuLaR,我们构建了 RGROUNDING-351K,这是一个真实世界的视觉语言数据集,用关键对象边界框和对象间关系进行注释。跨不同基准的大量实验表明,ReGuLaR 始终优于现有方法并实现了最先进的性能。我们将我们的代码包含在提交的内容中,并将在接受后公开发布代码和训练数据。