论文
从反思到信息:通过信息增益驱动的验证促进多模态推理
Reflect to Inform: Boosting Multimodal Reasoning via Information-Gain-Driven Verification
摘要
多模态 大语言模型 (MLLM) 实现了强大的多模态推理性能,但我们在长格式生成中发现了一种反复出现的故障模式:随着输出变长,模型逐渐偏离图像证据并依赖于文本先验,导致毫无根据的推理和幻觉。有趣的是,根据注意力分析,我们发现 MLLM 具有后期视觉验证的潜在能力,该能力存在但并未持续激活。受这一观察的启发,我们提出了视觉重新检查(VRE),这是一种自我进化的训练框架,使 MLLM 能够在推理过程中自主执行视觉内省,而无需额外的视觉输入。 VRE 不是从更强大的老师那里提炼视觉能力,而是通过利用模型本身生成反射痕迹来促进迭代式自我改进,通过信息增益使视觉信息变得可操作。跨多种多模式基准的大量实验表明,VRE 持续提高推理准确性和感知可靠性,同时大幅减少幻觉,尤其是在长链环境中。代码可在 https://github.com/Xiaobu-USTC/VRE 获取。