论文

MetaRAG:面向Agentic RAG的信念-动作对齐策略优化

MetaRAG: Belief-Action Aligned Policy Optimization for Agentic RAG

模型训练强化学习Agentic RL

摘要

智能体检索增强生成(RAG)要求语言模型决定何时继续搜索、何时回答。现有基于RL的方法依赖外部监督,忽视了智能体关于当前证据是否充分的内部信念。为解决这一问题,我们将搜索决策质量重新表述为信念-动作对齐,并提出MetaRAG,一个面向智能体RAG的信念-动作对齐策略优化框架。MetaRAG使用验证优先的动作生成(Verify-first Action Generation),在每次实际动作前引出显式的验证过程;并使用内部信念探测(Internal Belief Probing),从相同的问题-历史上下文估计策略模型自身对问题可答性的信念。基于这些,MetaRAG推导出一个一致性奖励,并进一步以答案正确性对其进行门控,避免强化内部一致但错误的轨迹。信念探测仅在训练期间使用,不引入推理时开销。在七个公开QA基准上的实验表明,MetaRAG持续改进了相对于强RL智能体RAG基线的准确率-效率权衡,其收益可迁移到深度研究设置、不同优化器和多个模型骨干。

MetaRAG:面向Agentic RAG的信念-动作对齐策略优化:论文配图
图1:基于RL的智能体RAG中三种监督范式的比较。MetaRAG通过将每个Search/Answer动作与策略模型自身对证据充分性的信念对齐,提供轻量的决策级监督,改善边界校准。