论文
SkillEvolBench:从情节经验到程序性技能演化的基准评测
SkillEvolBench: Benchmarking the Evolution from Episodic Experience to Procedural Skills
摘要
大语言模型(LLM)智能体在解决真实任务时积累丰富的情节式轨迹,但这类经验能否被提炼为可复用的程序性技能仍不清楚。我们提出SkillEvolBench,一个用于评估从经验复用到技能形成这一步的诊断性基准。它包含跨六个真实智能体环境的180个任务,组织为共享潜在流程、按角色划分的任务族。智能体从获取任务中学习,利用压缩轨迹与验证器反馈更新外部技能库,随后面对测试上下文迁移、对抗捷径与组合的冻结部署任务。通过将自生成与精选起点的技能演化同无技能及原始轨迹对照进行比较,SkillEvolBench把程序性抽象与基础能力、精选先验知识以及对情节轨迹的直接复用区分开来。在十个模型配置与三种智能体框架上,我们发现当前智能体常能局部适应,却很少形成稳健的可复用技能。基于技能的设定可以改善获取或重放,个别模型有时在特定部署维度上有所获益,但这些收益在冻结部署下并不稳定。原始轨迹复用常常优于蒸馏技能,这表明当前的抽象过程丢弃了对未来任务仍然有用的上下文与流程线索。容量与成本分析进一步表明,编写更多技能或构建更大的Tier-3资源库并不足够:额外的更新可以在提升覆盖的同时引入情节特异性漂移与流程杂乱。这些发现使SkillEvolBench成为衡量一次性经验何时转化为持久程序性知识而非任务局部记忆的试验台。
