论文

了解幻觉在多模态推理模型强化 后训练 中的作用

Understanding the Role of Hallucination in Reinforcement Post-Training of Multimodal Reasoning Models

模型评测模型行为与机制分析

摘要

强化学习 (RL) 最近在大型推理模型中取得的成功激发了 后训练 多模态 大语言模型 (MLLM) 越来越多地采用 RL,以增强其视觉推理能力。尽管许多研究报告了性能的提高,但仍不清楚强化学习训练是否真正使模型能够从视觉信息中学习。在这项工作中,我们提出了Hallucination-as-Cue Framework,这是一个分析框架,旨在从模型幻觉的角度研究基于RL的后训练对多模态推理模型的影响。具体来说,我们引入了幻觉诱导的、特定于模态的损坏,这些损坏会删除或替换导出正确答案所需的基本信息,从而迫使模型通过幻觉进行推理。通过在训练和评估期间应用这些损坏,我们的框架为诊断 RL 训练动态和理解数据集的内在属性提供了独特的视角。通过对多个多模态推理基准的广泛实验和分析,我们发现模型幻觉对于强化学习训练的作用比之前认识到的更为重要。例如,我们发现 RL 后训练 在纯粹的幻觉诱导设置下仍然可以显着提高模型的推理性能,在某些情况下甚至优于标准训练。这些发现挑战了关于 MLLM 推理训练的普遍假设,并激励了更多模态感知的基于 RL 的训练设计的开发。