论文

Dr. Free:自我进化的搜索Agent不需要难度奖励

Dr. Free: You Don't Need Difficulty Rewards for Self-Evolving Search Agents

模型训练合成数据

摘要

当前用于训练搜索Agent的无数据自进化方法的一个主要限制是它们依赖于基于难度的提议者奖励。这些方法奖励提议者生成挑战共同进化求解器的问题,使用求解器难度作为问题质量的代理指标。然而,仅凭难度还不足以区分需要交叉通道证据的问题和通过更简单的捷径即可回答的问题。此外,测量难度需要对每个候选问题重复部署求解器,从而导致大量的计算成本。在本文中,我们介绍了 Dr. Free,这是第一个自我进化的搜索框架,它消除了基于难度的提议者奖励,并直接优化了相对于快捷方式上下文的证据必要性。 Dr. Free 从知识图中对关系链进行采样,并将它们与对齐的段落配对,从而为问题生成提供了明确的多跳结构。仅当完整证据段落下目标答案的可能性超过所有评估的快捷方式上下文下的最大可能性时,生成的问题才会收到积极的信息增益奖励。由于该信号是根据教师强制的可能性计算的,因此无需进行通过率估计,并将提议者训练时间减少超过 7 倍。对七个开放域 QA 基准的实验表明,Dr. Free 的性能优于先前的无数据搜索Agent和监督基线,并且在多跳 QA 基准上有很大改进。