论文

GDPevo:用真实商业任务评估Agent自演化

GDPevo: Evaluating Agent Self-Evolution on Real Business Tasks

智能体系统Agent任务评测智能体自我改进

摘要

代理自我进化通过更新代理的持久状态,从其先前的经验中,并将这些经验重新用于解决相关任务,从而更有效地解决问题。评估自我进化是一项困难的任务:现有的基准测试覆盖了经济上有价值的任务领域,但不总是设计训练和测试任务以使在测试时间获得的收益可归因于训练经验,且仍然容易受到数据污染的影响。我们提出了GDPevo,这是一个基于GDP相关企业流程的工作流基准,并与完全自动化的数据管道一起生成它。其核心机制是规则混合,将每个企业流程分解为原子业务规则,然后在训练任务中分发这些规则的子集,并在保留测试的任务中重新组合它们,以使在测试时间获得的收益可归因于训练经验。GDPevo涵盖了CRM、ERP、金融、医疗保健、法律和数据驱动的工作流。其V1版本包含120个任务,在12组中,每个组有五个训练任务和五个保留测试任务。完全自动化使管道能够在两天内扩展到240个任务(V2),从而提供对污染的实际响应。使用GDPevo,我们评估了四个代理,每个代理都由一个代理箱和一个模型组成,分别在四种监督类型下进行四组任务的训练。自我进化始终提高了保留测试集上的准确度,最多可提高16.44个百分点。但经过自我进化的最佳代理仍然远低于完全知情的oracle上限91.6%,表明当前代理的自我进化能力仍远远未实现。我们公开发布了管道、基准和完整的评估结果,网址为https://github.com/Prism-Shadow/GDPevo。