论文

UniDoc-RL:具有分层操作和密集奖励的从粗到细的视觉 RAG

UniDoc-RL: Coarse-to-Fine Visual RAG with Hierarchical Actions and Dense Rewards

模型训练强化学习

摘要

检索增强生成 (RAG) 使用外部视觉知识扩展大型视觉语言模型 (LVLM)。然而,现有的视觉 RAG 系统通常依赖于通用检索信号,而忽略了复杂推理所必需的细粒度视觉语义。为了解决这个限制,我们提出了 UniDoc-RL,这是一个统一的强化学习框架,其中 LVLM 代理联合执行检索、重新排序、主动视觉感知和推理。 UniDoc-RL 将视觉信息获取表述为具有分层动作空间的顺序决策问题。具体来说,它逐步细化视觉证据,从粗粒度的文档检索到细粒度的图像选择和活动区域裁剪,使模型能够抑制不相关的内容并关注信息密集的区域。为了有效的端到端训练,我们引入了密集的多重奖励方案,为每个动作提供任务感知的监督。 UniDoc-RL 基于组相对策略优化 (GRPO),使代理行为与多个目标保持一致,而不依赖于单独的价值网络。为了支持这种训练范例,我们整理了一个带有细粒度动作注释的高质量推理轨迹的综合数据集。三个基准测试的实验表明,UniDoc-RL 始终超越最先进的基线,比之前基于 RL 的方法获得高达 17.7% 的收益。