论文
场景图思维:强化多模态的结构化视觉推理 大语言模型
Scene Graph Thinking: Reinforcing Structured Visual Reasoning for Multimodal Large Language Models
摘要
多模态 大语言模型 (MLLM) 表现出强大的感知和推理能力。然而,大多数现有模型都专注于孤立的对象,而忽略了有效目标导航的结构化关系,限制了它们在视觉密集型任务上的性能。为了应对这一挑战,我们引入了场景图思维(SaGe),这是一种新颖的范例,可以通过显式的场景图表示实现细粒度和结构化的视觉推理。具体来说,我们首先引入一个自动化数据引擎,它将平面图像文本语料库转换为结构化场景图,其中分层实体构成节点,不同的视觉关系定义边缘。在此基础上,我们通过从场景图中采样推理轨迹来构建 120K 高质量训练数据。然后,引入两阶段图对齐 后训练 范式,其中监督 微调 通过结构化推理内化 MLLM,随后的强化 微调 提出节点作为代理图奖励以巩固高效的图探索。通过精心策划的数据和图形对齐的训练,我们的方法在八个多模式基准上实现了显着改进,在细粒度感知和推理任务上展示了强大的有效性。代码可在 https://github.com/zwyang6/SaGe 获取。