论文

推理很重要:通过推理条件化偏好优化缓解多模态大推理模型的幻觉

Reasoning Matters: Mitigate Hallucination in Multimodal Large Reasoning Models via Reasoning-Conditioned Preference Optimization

模型训练偏好优化

摘要

多模态大型推理模型引入了推理范式,在复杂视觉-语言任务上展现出强大能力。然而,它们仍饱受严重幻觉的困扰。现有基于训练的方法通常通过响应级的直接偏好优化(DPO)缓解幻觉,其中思维链(CoT)与最终答案被视为整体输出并联合优化。我们揭示,这一公式化做法与仅答案优化表现相当,说明它主要学习的是答案级偏好,而CoT级监督未被充分利用。为解决该问题,我们显式构造一个面向CoT的偏好项,并推导出推理条件化直接偏好优化(RC-DPO):它将CoT建模为答案生成的条件,并在不同CoT条件下对比对同一偏好答案的偏好,从而促进支撑答案的推理链对齐。为进一步改进优化,我们提出推理增强的偏好数据生成策略:利用蒙特卡洛树搜索发现视觉上有依据且逻辑一致的CoT作为正样本,并用注意力引导的CoT token剪枝构造负样本。在多种模型和基准上的大量实验表明,RC-DPO有效缓解幻觉并提升多模态推理过程的可靠性。

推理很重要:通过推理条件化偏好优化缓解多模态大型推理模型的幻觉:论文配图
图1:MM-Eureka-7B生成的视觉问答示例,其中幻觉内容以红色标出,展示多模态大推理模型的幻觉问题。