论文
教 MLLM 说“不”:通过拒绝校准 GRPO 进行广义引用表达理解
Teaching MLLMs to Say No: Generalized Referring Expression Comprehension via Refusal Calibrated GRPO
摘要
我们解决了广义引用表达理解(GREC)这一具有挑战性但尚未充分探索的任务,该任务需要一个模型在文本表达式描述的对象存在时(正样本)对其进行本地化,并在文本表达式不存在时拒绝输出(负样本)。尽管多模态 大语言模型 (MLLM) 擅长定位现有对象,但由于训练期间缺乏负样本,它们常常无法拒绝不存在的对象,从而产生幻觉的边界框。现有的 后训练 方法,例如有监督的 微调 (SFT) 和强化学习 (RL) 可以增强拒绝行为,但通常会降低正样本的定位精度,从而损害模型的核心能力。为了解决这个问题,我们提出了拒绝校准组相对策略优化(RC-GRPO),这是一种校准的 RL 策略,可以增强 MLLM 的拒绝能力,同时保持定位性能。它在采样轨迹中强制执行“无”输出,以对负样本进行有效的优势估计,并应用惩罚来防止对正样本的过度拒绝,从而实现准确性和可靠性之间的平衡权衡。第二阶段的推理强化进一步巩固了因果理解和可解释性。在三个 GREC 基准上的实验表明,RC-GRPO 在保持强大的拒绝能力的同时获得了卓越的定位精度。