论文

将想法与答案结合起来:抑制思维漂移的概率奖励

Aligning Thoughts with Answers: Probability Rewards to Tame Thinking Drift

模型训练强化学习

摘要

本文研究视觉语言模型中的思维--答案一致性。我们专注于视觉意图基础,其中模型根据人类意图查询推断目标对象并预测边界框。我们发现,之前基于 IoU 的强化学习 (RL) 框架存在“思维漂移”的问题,即模型会产生正确的边界框,尽管有一个指向不同目标对象的错误推理过程。因此,我们提出 Rita (强化思维——答案一致性)作为一种新颖的强化学习范式来驯服这种漂移。具体来说,Rita 引入了两种无推理标签的 RL 奖励,它们是根据参考答案的条件概率构建的:思维奖励 和 一致性奖励。它还采用了一种难度感知的数据过滤策略,使用rollout错误率和奖励方差为强化学习选择信息丰富的简单到中等的样本。对 EgoIntention 和新的 RefEgo-Int 基准的大量实验表明,Rita 的表现始终优于监督微调方法和普通 RL 微调框架。