论文
Actor 作为自己的批评者:通过 CycleGRPO 统一区域理解和本地化
Actor as Its Own Critic: Unifying Region Understanding and Localization via CycleGRPO
摘要
本文介绍了 Actor 作为其自己的批评者,这是一个统一的强化学习框架,循环组相对策略优化 (CycleGRPO),它联合优化多模态 大语言模型 (MLLM) 的区域理解和本地化。与现有的单独管道不同,我们利用两个任务之间固有的二元性来构建一个自我评估的强化学习范式:“region $\to$ text $\to$region”。具体来说,单个 MLLM 首先充当参与者来生成区域描述,然后立即转换为批评者以将其生成的文本重新置于空间域中。因此,CycleGRPO 仅需要区域输入,例如掩模或边界框,完全绕过了对文本基本事实的需要。 词元级 循环一致性奖励用于通过其物理定位准确性来评估文本字幕的语义可辨别性。根据经验,我们的 CycleGRPO 框架基于 SAMTok 成功地同时启动了这两种功能,而无需任何特定于任务的 微调,该框架在各种基准测试中产生一致的性能增益,包括区域描述、区域 VQA、基于视觉定位的对话和引用分割。代码和模型发布于 https://github.com/devinxzhang/CycleGRPO。