论文
MCite-RL:通过引文增强代理强化学习实现可靠的多模态 RAG
MCite-RL: Towards Reliable Multimodal RAG via Citation-enhanced Agentic Reinforcement Learning
摘要
具有视觉引用的多模态检索增强生成 (RAG) 对于确保 MLLM 的可追溯性和可验证性至关重要。然而,当前基于 RAG 和 SFT 的方法难以实现稳健的跨模态推理,导致视觉引用不精确或引用与生成的答案之间脱钩。为了解决这些限制,我们提出了 MCite-RL,一种引文增强的代理强化学习框架,专为可靠的多模态 RAG 设计。 MCite-RL 引入了用于视觉引用的 Agentic Refinement 模块,该模块采用迭代检索、推理和递归裁剪来逐步缩小搜索空间,将引用转变为动态、证据驱动的推理过程,而不是静态步骤。此外,我们还采用了引文增强奖励机制,将过程级和结果级反馈整合到强化学习范式中,以共同优化答案准确性和来源可追溯性。在Wiki-VISA、FinRAGBench-V、MMLongBench-Doc等基准上的大量实验表明,MCite-RL有效地实现了引文精度和答案质量的联合优化。