论文

经由合成语义信息增益奖励优化带检索的 Agentic 推理

Optimizing Agentic Reasoning with Retrieval via Synthetic Semantic Information Gain Reward

模型训练强化学习奖励建模与过程监督RLVRAgentic RL

摘要

代理推理使大推理模型(LRM)能够动态获取外部知识,但由于缺乏密集的、有原则的奖励信号,优化检索过程仍然具有挑战性。在本文中,我们介绍了 InfoReasoner,这是一个统一的框架,它通过合成语义信息获得奖励来激励有效的信息搜索。理论上,我们将信息增益重新定义为模型信念状态的不确定性减少,建立保证,包括非负性、伸缩可加性和通道单调性。实际上,为了在无需手动检索注释的情况下实现可扩展优化,我们提出了一种输出感知内在估计器,它通过双向文本蕴涵使用语义聚类直接从模型的输出分布计算信息增益。这种内在奖励引导策略最大化认知进展,通过组相对策略优化(GRPO)实现高效训练。七个问答基准的实验表明,InfoReasoner 始终优于强大的检索增强基线,平均准确度提高高达 5.4%。我们的工作为通过检索进行代理推理提供了一条有理论基础且可扩展的路径。

经由合成语义信息增益奖励优化带检索的 Agentic 推理
图1:InfoReasoner 概览。该框架通过采样候选答案并将语义等价的答案分组来估计智能体的信念状态。然后,它通过度量提供检索证据相比无检索基线时语义不确定性(熵)的减少来计算 Information Gain 内在奖励,从而激励智能体获取能够解决不确定性的信息。