论文

归功于正确的盒子:结构化视觉感知的边际贡献分配

Credit the Right Box: Marginal Contribution Assignment for Structured Visual Perception

模型训练强化学习

摘要

人们越来越期望多模态 大语言模型 (MLLM) 能够解决需要视觉识别、语言到对象绑定、对象基数保留以及精确本地化基础和分割输出的结构化感知任务。然而,现有的与组相关的强化学习方法仅提供响应级别的监督,从而为结构化多对象预测造成粒度不匹配:单个优势被广播到响应中的所有标记,而不区分各个框的贡献。为了解决这种不匹配问题,我们提出了 MCR-GRPO,这是一种边际贡献分配框架,可直接从每个采样响应中得出框级信用。具体来说,边际贡献奖励(MCR)通过留一比较来估计每个预测框的贡献,测量当框从响应中移除时匹配的设定值如何变化。响应内标准化后,提高设定值的记录将获得积极的信用,而冗余或有害的记录将被抑制。为了使边际归因稳定且信息丰富,我们进一步引入了连续匹配集值评估器,它集成了排列不变匹配、计数感知归一化和分级定位。 MCR-GRPO 将标准化的框级边际优势映射到生成每个框的词元跨度,保留 GRPO 的响应级别比较,同时实现结构化多对象视觉定位的框感知优化。跨 REC、DOD、分段和计数基准的实验表明,与之前基于 GRPO 的基准相比,具有最先进的性能。