论文
经由合成语义信息增益奖励优化带检索的 Agentic 推理
Optimizing Agentic Reasoning with Retrieval via Synthetic Semantic Information Gain Reward
摘要
代理推理使大推理模型(LRM)能够动态获取外部知识,但由于缺乏密集的、有原则的奖励信号,优化检索过程仍然具有挑战性。在本文中,我们介绍了 InfoReasoner,这是一个统一的框架,它通过合成语义信息获得奖励来激励有效的信息搜索。理论上,我们将信息增益重新定义为模型信念状态的不确定性减少,建立保证,包括非负性、伸缩可加性和通道单调性。实际上,为了在无需手动检索注释的情况下实现可扩展优化,我们提出了一种输出感知内在估计器,它通过双向文本蕴涵使用语义聚类直接从模型的输出分布计算信息增益。这种内在奖励引导策略最大化认知进展,通过组相对策略优化(GRPO)实现高效训练。七个问答基准的实验表明,InfoReasoner 始终优于强大的检索增强基线,平均准确度提高高达 5.4%。我们的工作为通过检索进行代理推理提供了一条有理论基础且可扩展的路径。
