论文

学会思考:通过视觉感知自我提升训练提高多模式推理

Learn to Think: Improving Multimodal Reasoning through Vision-Aware Self-Improvement Training

模型训练监督微调与指令调优

摘要

具有显式推理轨迹的 后训练 通常用于提高多模态 大语言模型 (MLLM) 的推理能力。然而,获取高质量的推理痕迹通常成本高昂且耗时。因此,自我改进范式应运而生,使 MLLM 能够在没有外部监督的情况下自行生成训练推理轨迹。尽管其有效,但我们揭示了 MLLM 自我改进训练中的两个缺点:1)数据不平衡,简单样本训练过度,但具有挑战性但关键的样本训练不足; 2)语言先验偏差,MLLM 过度依赖语言先验,而忽略视觉提示。为此,我们提出了 VISTA,一个视觉感知的自我完善训练框架,用于增强 MLLM 的多模态推理。具体来说,VISTA首先引入了前缀重采样策略,以重用部分正确的推理轨迹来实现高效的数据收集,然后设计视觉感知的注意力分数来量化模型对视觉信息的关注程度。大量实验表明,VISTA可以应用于各种后训练场景,即监督微调和偏好学习,并有效增强跨各种MLLM和任务的多模态推理性能,例如,为Qwen2.5-VL-3B-Instruct带来高达+13.66%的平均性能提升。