论文

SkillEvolBench:从情节经验到程序性技能演化的基准评测

SkillEvolBench: Benchmarking the Evolution from Episodic Experience to Procedural Skills

智能体系统上下文与知识记忆Agent任务评测Agent SkillsAgent记忆

摘要

大语言模型(LLM)智能体在解决真实任务时积累丰富的情节式轨迹,但这类经验能否被提炼为可复用的程序性技能仍不清楚。我们提出SkillEvolBench,一个用于评估从经验复用到技能形成这一步的诊断性基准。它包含跨六个真实智能体环境的180个任务,组织为共享潜在流程、按角色划分的任务族。智能体从获取任务中学习,利用压缩轨迹与验证器反馈更新外部技能库,随后面对测试上下文迁移、对抗捷径与组合的冻结部署任务。通过将自生成与精选起点的技能演化同无技能及原始轨迹对照进行比较,SkillEvolBench把程序性抽象与基础能力、精选先验知识以及对情节轨迹的直接复用区分开来。在十个模型配置与三种智能体框架上,我们发现当前智能体常能局部适应,却很少形成稳健的可复用技能。基于技能的设定可以改善获取或重放,个别模型有时在特定部署维度上有所获益,但这些收益在冻结部署下并不稳定。原始轨迹复用常常优于蒸馏技能,这表明当前的抽象过程丢弃了对未来任务仍然有用的上下文与流程线索。容量与成本分析进一步表明,编写更多技能或构建更大的Tier-3资源库并不足够:额外的更新可以在提升覆盖的同时引入情节特异性漂移与流程杂乱。这些发现使SkillEvolBench成为衡量一次性经验何时转化为持久程序性知识而非任务局部记忆的试验台。

SkillEvolBench:从情节经验到程序性技能演化的基准评测:论文配图
图 1:SkillEvolBench 探讨了情景座席经验是否可以抽象为可重用的程序技能。在获取过程中,每次符合条件的尝试都会生成记录的执行工件,这些工件被压缩为结构化轨迹摘要并与验证者反馈配对。主机端技能作者调用与任务解决代理循环分离,使用此证据和当前的家庭技能状态来编写、完善或跳过库更新。由此产生的技能库在更困难的部署任务之前被冻结,因此后来的成功取决于先前的经验是否已转换为可重用的过程,而不是直接跟踪重播、持续适应或测试时修复。