论文
从失败到反馈:团体修订解锁对象级目标定位中的困难案例
From Failure to Feedback: Group Revision Unlocks Hard Cases in Object-Level Grounding
摘要
通过强化学习对大型视觉语言模型进行微调已成为增强其对象级基础能力的一种有前景的方法。然而,现有的方法主要基于GRPO,在响应级别分配奖励。当所有候选响应在具有挑战性的场景中失败时,这种稀疏的奖励(通常是由标准引起的)会导致最小的学习信号。在这项工作中,我们提出了一种小组修订优化范例,可以增强对困难案例的学习。它从抽样的初始响应开始,并生成一组修改后的候选方案,以探索改进的目标定位结果。受奖励塑造的启发,我们引入了一个整合过程,量化每个候选人相对于初始尝试的改进,并将其转换为信息丰富的塑造信号。这些信号用于细化奖励并调节优势,放大高质量修订的影响力。与之前基于 GRPO 的模型相比,我们的方法在引用和推理分割、REC 和计数基准方面取得了一致的收益。我们的代码可在 https://github.com/yyliu01/GroupRevision 获取。