论文

SAVOR:通过置信度校准强化学习实现自我意识视觉基础,以缓解多模式幻觉

SAVOR: Self-Aware Visual Grounding via Confidence-Calibrated Reinforcement Learning for Multimodal Hallucination Mitigation

模型训练强化学习

摘要

多模态大语言模型(MLLM)在视觉问答和图像字幕方面取得了长足的进步,但它们仍然可以对不以图像为基础的对象、属性或关系产生流畅的声明。许多补救措施要么在测试时修改解码,这会增加延迟,要么根据 DPO 变体等首选项进行微调,这些首选项会告诉您哪个答案是首选,但当模型自己的答案不可靠时则不会。我们认为,校准后的自我评估是缺失的信号。我们引入了 Savor,一个训练框架,它(i)通过标记和答案置信度增强输出模式,(ii)通过组相对策略优化(GRPO)目标优化策略,惩罚校准错误和不良的弃权决策,以及(iii)仅在模型不确定时使用推理时学到的置信度重新审视视觉证据。在最近的两个骨干网(InternVL3-8B 和 Qwen3-VL-8B)上对 POPE、HallusionBench、AMBER 和 MMHal-Bench 进行的实验表明,Savor 减少了幻觉,同时保留了 MME 和 MMBench 上的一般功能,并且预期校准误差低于 DPO 和解码基线。