FinEvo-Bench:专业金融工作流中自演化Agent的纵向基准
FinEvo-Bench: A Longitudinal Benchmark for Self-Evolving Agents in Professional Financial Workflows
摘要
大多数代理基准独立评估任务,无法衡量经验从一个任务转移到另一个任务时是否有助于后续任务。现有的自我进化基准未能同时涵盖专业工作流程、开放型成果以及多方面评价。我们引入FinEvo-Bench,这是一个包含120个基于实际案例的任务,覆盖六个金融领域的20个业务场景。机构提供的专业程序定义了所需的操作和约束条件。可选的机构提供和公开文档的任务事实为任务提供了依据。每个场景包含六个相关的但实质性不同的任务,这些任务共享一个专业的程序,并且有手动审查的评分标准来评估任务质量和财务合规性。我们使用相同的Qwen3.7-Max骨干对四种自我进化代理框架进行比较,这些框架由三个独立的全球交错的任务流组成。配对的非进化控制组估计每个框架在保留经验后自进化收益,而一个由Claude Opus 4.6支持的独立Claude Code评分Agent评估所有输出。Letta获得了最高的进化分数(91.65),并且每项任务上的合规问题最少,为0.09个;Codex获得了最大的自进化收益(+19.37)。在四种代理框架中,随着任务的进化,分数提高了9.33-19.37点,并且减少了每项任务上的合规问题0.12-0.44。同一场景中第4—6项任务的配对分数增益,比第1—3项任务高6.10—8.70个百分点。在Claude Code中,技能型进化比记忆型和结合记忆与技能的进化产生更高的任务质量和更低的合规问题。在整个四种代理框架中,评分反馈也产生了更高的分数和更低的合规问题,而参考答案反馈则相反。FinEvo-Bench同时衡量了专业表现和自进化能力:一个代理如何有效地将前一个经验转化为后续改进。
