论文

细粒度 MLLM 感知的区域级政策优化

Region-Level Policy Optimization for Fine-grained MLLM Perception

模型训练强化学习

摘要

MLLM 中的细粒度视觉感知通常可以通过提高分辨率来改善,但增加的视觉标记会增加视觉编码和语言模型预填充成本。我们表明,细粒度感知的两种操作,即定位感兴趣区域(RoI)和识别其内容,具有不同的分辨率要求。在受控诊断中,定位可以承受比识别强大约 3 到 4 倍的标记压缩,这促使从粗略视图进行定位并将分辨率集中在所选证据上。使用 MLLM 解码坐标可以根据答案进行端到端训练,但每次查询都会花费完整的模型传递,并且取决于基础能力。从模型注意力中提取的轻量级提议网络速度很快,但继承了其注意力目标的噪声。提案网络的 RoI 通过离散区域选择得出答案,因此其对答案的忠实度无法监督网络。因此,我们通过区域级强化学习来优化提案网络,我们称之为 Vision-RL2。它将相干区域视为动作,冻结的 MLLM 阅读器根据其删除如何改变答案可能性来对每个区域进行评分。互补的减法​​和加法目标抑制分散注意力的建议并恢复丢失的证据,仅更新预测变量,而无需区域注释、响应采样或推理轨迹。改进后的提案进一步实现了稀疏编码,可以放大证据并排除背景标记。在六个细粒度基准和四个 MLLM 主干上,Vision-RL2 在每个词元预算下都提高了基本模型的准确性,并以减少约 4 倍的视觉词元超过了其最大预算准确性。代码可在 https://github.com/YuHengsss/VisionRL2 获取。