论文
DEEPO:面向多模态大模型幻觉的双熵增强策略优化
DEEPO: Dual-Entropy Enhanced Policy Optimization for Hallucination in MLLMs
摘要
强化学习(RL)被广泛用于提升多模态大语言模型(MLLM)的推理能力,但其对幻觉的效果并不均衡。我们将其归因于从奖励到参数更新的纠正链中的两个薄弱环节。在rollout层面,困难查询——即语义熵高的查询——经常产生一致错误的样本组,使组相对优势恰好在幻觉风险最高之处塌缩为零。在优化层面,自信但错误的token是梯度不可见的:类别策略的期望得分梯度范数随其分布变锐而趋于零,因此最需要纠正的预测收到的更新最弱。我们提出双熵增强策略优化(DEEPO),一个结合信号方差正则化与梯度预条件的双阶段增强:语义熵触发的专家前缀在高不确定性查询上注入有依据的续写,提供直接监督并恢复优势方差;优势符号感知的Renyi预条件则对抗logit层面的饱和,使纠正能够到达运行置信区间内的自信错误。两个分支单独使用均优于GRPO;其交互在VideoMMMU——我们评测套件中最复杂的长时程任务——上统计显著(+4.0,95% CI [1.1, 6.9]),在其他任务上则具有可加性。DEEPO在保持准确率与训练稳定性的同时减少幻觉。
