论文
FinEvolveBench:具有隐式奖励的低重复任务的自我进化代理基准
FinEvolveBench: A Benchmark for Self-Evolving Agents on Low-Repetition Tasks with Implicit Rewards
摘要
大语言模型 (LLM) 代理越来越依赖外部经验来不断适应不断变化的环境,而无需修改其底层模型。最近的经验机制在不同的任务中表现出了有希望的结果。然而,它们的有效性通常是在单独的基准设置内评估的,并且经验机制如何在不同场景中推广仍然没有得到充分的探索。在这项工作中,我们对 LLM 代理的体验机制进行了面向场景的分析。我们从四个维度描述现有评估场景:结果可观察性、贡献分配复杂性、环境动态和经验可重用性。我们的分析表明,现有的基准通常在至少一个维度相对有利的场景下评估体验机制,而没有充分探索更具挑战性的场景属性组合。为了解决这一差距,我们引入了 \textsc{FinEvolveBench},这是一个建立在丰富的金融新闻和市场数据的时间流上的可重复基准,能够在具有挑战性的经验制度下系统地评估基于经验的自我进化,这些经验制度的特点是噪声反馈、模糊的贡献分配、环境非平稳性和有限的经验可重用性。实验表明,现有方法在这种情况下表现出大幅减少或不一致的增益,突出了体验机制的场景依赖性质以及在不断变化的环境下保持有效体验的挑战。