论文
REC-RL:通过高斯和基于范围的奖励优化进行引用表达计数
REC-RL: Referring expression counting via Gaussian and range-based reward optimization
摘要
引用表达计数 (REC) 是一项意图驱动的任务,需要上下文感知的视觉推理。虽然最近的视觉语言模型结合了用于视觉理解的语言,但大多数现有的 REC 方法依赖于基于规则的强化学习,其奖励主要侧重于最终的准确性,而忽略了中间推理的质量。我们提出了 REC-RL,这是一种强化学习框架,它引入了思考范围答案范式来显式优化视觉推理过程。 RECRL 采用组相对策略优化和两个轻量级奖励:将基于范围的区间监督与基于高斯的精确指导相结合的准确性奖励,以及强制结构化输出的格式奖励。通过将中间焦点预测建模为内部决策,REC-RL 避免了额外的注释并更好地符合人类感知。大量的实验证明了对强基线的持续改进以及跨基准的稳健泛化。