论文

SkillLearnBench:对现实世界任务中代理技能生成的持续学习方法进行基准测试

SkillLearnBench: Benchmarking Continual Learning Methods for Agent Skill Generation on Real-World Tasks

智能体系统Agent任务评测

摘要

技能已成为使 LLM 智能体能够通过定制的指令、工作流程和工具执行复杂的现实任务的事实上的方式,但如何自动有效地学习它们仍然不清楚。我们推出了 SkillLearnBench,这是第一个评估持续技能学习方法的基准,包括来自现实世界技能分类法的 15 个子领域的 20 个经过验证的、依赖于技能的任务,从三个层面进行评估:技能质量、执行轨迹和任务结果。使用这一基准,我们评估最近的持续学习技术,这些技术利用一次性、自我/教师反馈和技能创建器从代理经验中生成技能。我们发现所有持续学习方法都比无技能基线有所改善,但一致的收益仍然难以捉摸:没有一种方法可以在所有任务和 LLM 上取得领先,并且扩展到更强的 LLM 也没有可靠的帮助。持续学习可以通过清晰、可重用的工作流程来改进任务,但在开放式任务上却举步维艰,而且使用更强大的 LLM 主干并不能始终产生更好的技能。我们的分析还表明,持续学习中的多次迭代可以通过外部反馈促进真正的改进,而单独的自我反馈会导致递归漂移。我们的数据和代码在 https://github.com/cxcscmu/SkillLearnBench 上开源,以便进一步研究自动技能生成和持续学习技术。