论文
搜索Agent的上下文信息策略优化
Contextual Information Policy Optimization for Search Agents
摘要
搜索代理通过允许它们在多步推理过程中获取和使用外部证据,将大语言模型扩展到静态参数化记忆之外。对于涉及复杂或不断变化信息的任务,其可靠性不仅取决于检索相关证据,还取决于使用这些证据来指导后续推理。然而,现有的方法主要奖励最终答案的正确性或中间进展,而不直接评估在检索后行动是否基于检索到的证据。这种不匹配鼓励前向推理:代理根据内部知识形成结论,并主要通过检索来确认它们,导致确认偏见和低效证据使用。为解决这个问题,我们提出Contextual Information Policy Optimization (CIPO),一个证据导向的强化学习框架,明确将政策优化与外部证据使用相结合。CIPO为受检索影响的推理行动分配密集、回合制的奖励,同时结合证据使用信号与全局结果奖励来保留答案正确性。在这种方式下,CIPO鼓励不脱离证据猜测,并促进在后续推理中检索到的事实可以引导或修订推理的过程。重要的是,CIPO不需要人类过程注释或额外的奖励模型。我们在七个领域内和外部基准上的广泛实验表明,CIPO减少了前向推理的比例,并在大多数任务上取得了出色的表现。
