论文
持续学习基准:在真实统计环境中评估前沿AI系统
Continual Learning Bench: Evaluating Frontier AI Systems in Real-World Stateful Environments
摘要
持续学习,即人工智能系统通过连续经验进行改进的能力,引起了人们的极大兴趣,但没有高质量的基准来评估它。我们推出了持续学习基准 (CL-Bench),这是第一个经过专家验证的困难基准,旨在衡量基于 LLM 的系统是否真正随着经验而改进。 CL-Bench 跨越六个不同的领域(软件工程、信号处理、疾病爆发预测、数据库查询、战略博弈和需求预测),每个领域都经过领域专家的验证,并设计为任务共享一个可学习的潜在结构(代码库布局、疾病爆发动态、对手策略),有状态系统可以在线发现,但无状态系统则不能。我们评估了多种代理架构的前沿模型,从朴素的上下文学习(ICL)到专用记忆系统,引入增益指标来将学习与先前的能力隔离开来。我们发现这些系统为改进持续学习留下了空间:智能体经常过度适应即时观察或无法跨实例重用知识,而专用内存系统无法解决这个问题——事实上,朴素 ICL 的性能优于专用于内存管理的系统。 CL-Bench 是第一个通过专家验证的任务来评估跨不同现实世界领域的持续学习的基准,并将在线学习与底层模型功能隔离开来,这表明需要更好的持续学习系统。
