论文

持续学习基准:在真实统计环境中评估前沿AI系统

Continual Learning Bench: Evaluating Frontier AI Systems in Real-World Stateful Environments

智能体系统上下文与知识记忆Agent任务评测Agent记忆

摘要

持续学习,即人工智能系统通过连续经验进行改进的能力,引起了人们的极大兴趣,但没有高质量的基准来评估它。我们推出了持续学习基准 (CL-Bench),这是第一个经过专家验证的困难基准,旨在衡量基于 LLM 的系统是否真正随着经验而改进。 CL-Bench 跨越六个不同的领域(软件工程、信号处理、疾病爆发预测、数据库查询、战略博弈和需求预测),每个领域都经过领域专家的验证,并设计为任务共享一个可学习的潜在结构(代码库布局、疾病爆发动态、对手策略),有状态系统可以在线发现,但无状态系统则不能。我们评估了多种代理架构的前沿模型,从朴素的上下文学习(ICL)到专用记忆系统,引入增益指标来将学习与先前的能力隔离开来。我们发现这些系统为改进持续学习留下了空间:智能体经常过度适应即时观察或无法跨实例重用知识,而专用内存系统无法解决这个问题——事实上,朴素 ICL 的性能优于专用于内存管理的系统。 CL-Bench 是第一个通过专家验证的任务来评估跨不同现实世界领域的持续学习的基准,并将在线学习与底层模型功能隔离开来,这表明需要更好的持续学习系统。

持续学习基准:在真实统计环境中评估前沿AI系统:论文配图
图 1:CL-Bench 评估框架,通过简化的数据库探索任务进行说明。在每个 CL-Bench 任务中,代理在共享环境中完成一系列实例,积累过去的经验和反馈以随着时间的推移进行改进。任务包含先验未知的可利用的潜在结构(这里是模糊的模式约定),学习代理需要发现这些结构以提高奖励(例如,Q10 的查询减少 4×4\ 倍)。任务还可能存在概念漂移:第 20 季度的数据库迁移使过去的部分经验失效,测试智能体是否能够适应而不是盲目记忆。