论文

EVE-Agent:证据可验证的自进化智能体

EVE-Agent: Evidence-Verifiable Self-Evolving Agents

模型训练合成数据

摘要

自进化智能体不应在无法自证的样本上训练。无数据的自进化搜索智能体为以下系统提供了可扩展的路径:自行生成问题、回答问题,并在无人工标注的情况下从自身反馈中改进。然而,在没有可验证证据的情况下,这一循环可能奖励流畅却无依据的样本,使自生成课程沦为不透明且潜在不可靠的训练信号。我们主张证据可验证性是搜索智能体可信自进化的前提:每个生成的样本不仅应包含答案,还应包含一个有源可依、其对答案的贡献可被度量的文本片段。我们提出EVE-Agent,一个证据可验证的自进化智能体,它通过对提出者—求解者框架的改造将这一原则付诸实施。提出者生成一个问题、一个答案以及一段逐字证据片段。随后证据验证者根据提供证据时带来的边际准确率增益对片段进行奖励。这产生了偏向真正有助于回答问题的证据的训练信号,且无需标准答案、人工标签或外部标注。EVE-Agent不改动骨干模型、检索器、搜索工具与优化框架。实验表明,EVE-Agent相较以往的自进化搜索智能体大幅提升了基于证据的正确性。由此得到的课程不仅是自生成的,而且天然可审计:每个训练样本都带有可检查的源片段,说明其为何值得信任。

EVE-Agent:证据可验证的自进化智能体:论文配图
图 1:可证据验证的自我进化搜索代理。现有的自我进化搜索代理(左)仅使用基于求解器准确性的难度信号来奖励提议者,而无需审核每个问题背后的源证据。 EVE-Agent(右)要求提议者输出基于源的证据范围,并且仅当该证据因果关系提高了求解器的答案准确性时才奖励它,通过从无证据到有证据的推出的增益来衡量。此次修改仅限于奖励:提议者、求解器、骨干模型和搜索工具保持不变。