论文
PAST-Bench:个人代理递归自我改进基础的基准测试
PAST-Bench: Benchmarking the Foundations of Recursive Self-Improvement in Personal Agents
摘要
递归的自我改进要求智能体将积累的经验转化为更好的未来行为。个人人工智能代理为研究这种能力提供了一个具体的环境,因为它们保留了偏好、任务历史记录、工具例程和跨会话学习的技能。然而,随着时间的推移,保留的经验是否真的能提高他们的水平,还没有经过系统的测试。我们引入了 PAST-Bench,这是一个旨在隔离这个问题的基准测试。每个代理在匹配的条件下运行新鲜会话任务的有序序列,从而打开和关闭保留的体验。它涵盖了 26 个场景和 204 个情节,涉及记忆、程序重用、信息收集和更新。我们报告后期任务的收益以及这些收益是否遵循预期的保存、检索和更新路径。在七个基本模型和四个代理框架中,改进是真实的,但各个功能的改进并不均衡。具有相同标题收益的代理商可能在该收益是否得到预期途径证据的支持方面存在显着差异。在这些发现的指导下,我们开发了 Hermes+,它通过跨代理循环阶段的五种有针对性的干预措施扩展了 Hermes。 Hermes+ 提高了保留经验的平均收益,并提供了更清晰的途径证据,对需要替换过时状态的任务的改进最为明显,尽管效果仍然取决于能力和模型。 PAST-Bench 和 Hermes+ 共同提供了评估和诊断基础,用于研究持久性代理如何从保留经验到通过经验进行系统改进。代码:https://github.com/Gen-Verse/PAST-Bench