论文

思考、观察和修改:MLLM 中的不一致感知视觉自我校正

Think, Look, and Revise: Inconsistency-Aware Visual Self-Correction in MLLMs

模型训练强化学习

摘要

工具增强多模态推理将外部工具(例如对象检测、深度估计)集成到多模态 大语言模型 (MLLM) 中,以解决复杂视觉任务中的感知瓶颈。然而,现有方法很少验证工具输出,限制了它们检测工具故障并从中恢复的能力。我们提出了 ReVISE,这是一个为 MLLM 配备验证和动态错误恢复功能的框架,用于工具增强推理。 ReVISE 引入了 (1) 一个精心策划的训练数据集,用于监督反思行为,使模型能够验证工具衍生的证据,在出现视觉不匹配时重新制定查询,并在外部工具不可靠时回退到内在基础; (2)基于强化学习的有针对性的奖励,鼓励内部反思并惩罚空间错位。多个基准的实验证明了对现有方法的持续改进,凸显了错误检测和纠正在工具增强多模态推理中的重要性。