论文

通过感知验证的自我训练改进视觉语言模型的推理

Improving Reasoning in Vision-Language Models via Perception Verified Self-Training

模型训练合成数据

摘要

在视觉语言模型(VLM)中实现类人推理仍然是一个长期存在的挑战。最近的方法利用人类注释者或专有模型生成的思想链(CoT)基本原理,这些原理成本高昂且难以扩展。自我训练提供了一种很有前途的替代方案,但经常会出现视觉幻觉和语言捷径,因为仅通过答案正确性来过滤基本原理,而不验证视觉感知。我们提出了一个经过感知验证的自我训练框架,该框架强制执行基于视觉的推理。我们的方法采用 CoT 模板(图像描述—推理—结论),将感知与推理分开,从而实现视觉理解的独立验证。为了弥补 真值图像描述的缺失,我们引入了 PerceptEval,这是一种无监督方法,可根据字幕与图像中视觉和文本元素的对齐情况来评估字幕质量。使用标题验证和答案正确性,我们将数据分为简单、中等和困难子集,并设计一个两阶段的课程学习策略。第一阶段在简单样本上进行训练,而第二阶段则通过根据经过验证的标题重​​新生成推理并仅保留那些具有正确结论的样本来增强中等样本。这确保了训练完全基于基于感知的推理,减少幻觉和语言捷径。跨不同领域和模型的广泛实验表明,与标准自我训练基线相比,性能提升高达 16%,这表明我们的框架为推进多模态推理提供了一种可扩展且经济高效的解决方案,无需手动注释 CoT 原理。