论文
SCLATE:持续学习Agent训练和评估的基础
SCLATE: a Substrate for Continual-Learning Agent Training and Evaluation
摘要
持续学习Agent是在长期多会话范围内运行的模型、Harness和记忆系统。评估和训练它们需要将任务与Agent端事件(例如会话停止和启动、crons 和内存整合)交错。然而,现有的基准测试和训练框架仅调度基准测试自己的事件,让每个基准测试和Agent对构建自定义调度循环。我们提出了 SCLATE,这是一种执行基础,其中基准测试和未修改的Agent各自通过适配器将其事件添加到一个开放的事件调度程序中。混合模拟时钟在共享时间线上运行这些事件,在Agent工作时实时流动并跳过空闲间隙,从而将长达一个月的场景压缩为几个小时。 SCLATE 还充当rollout引擎,可在不修改的情况下运行任何Agent的Harness和记忆,通过容器内Agent记录每个模型调用的词元和对数概率。我们将七个基准测试移植到 SCLATE,并在十个模型上直接比较十个未经修改的Harness和内存配置。比较表明,添加的内存系统无法可靠地击败Harness的本机内存,并且模型在使用相同Harness和内存的方式方面存在很大差异。然后,我们通过未修改的Harness和记忆系统对 Qwen3.5-4B 进行后训练。该模型学会了使用这两种方法,读取的文件行数减少了 6.8 倍,SWE 基准验证通过率提高了 16.7 点,并写入了更丰富的内存记录,同时其留出集上的 MetaClaw 准确度提高了 11.8 点。