论文
智能体优化器会复利吗:Terminal-Bench 2.0上的持续学习评估
Do Agent Optimizers Compound? A Continual-Learning Evaluation on Terminal-Bench 2.0
摘要
智能体优化方法报告的大多数增益是一次性的:智能体针对固定基准被优化一次,其改进被报告得像是方法的稳定属性。这没有检验部署智能体的真实设定——优化随新失败与新任务出现被递归应用。由此引出的中心问题是优化器驱动的增益能否复利:智能体被优化一次后,能否在新到达的任务上再次被优化而不侵蚀首轮增益?我们以Terminal-Bench 2.0困难任务构建的两阶段持续学习评估研究该问题:在相同优化预算下比较三种智能体治控优化方法(GEPA、Meta Harness与RELAI的可验证持续学习RELAI-VCL)。三种方法在常规静态单阶段设定下都改进基线智能体。但一旦引入新任务,方法急剧分化:GEPA优化出的智能体迁移到未优化基线之下;Meta Harness迁移良好但获得第二次优化预算后无法继续改进;RELAI-VCL是唯一既正向迁移到未见任务、又在这些任务并入优化目标后继续改进的方法——在每个评估阶段都达最高通过率、整体终身平均通过率最高(76.4%,对比GEPA 66.0%、Meta Harness 64.6%、基线58.7%)。关键观察:只有当回归控制内建于优化回路时优化增益才复利——它提供对抗无法泛化的捷径解的归纳偏置。