论文
ModularRSI:可跨任务迁移的模块化Harness递归自我改进
ModularRSI: Modular and Generalizable Recursive Harness Self-Improvement
摘要
最近的工作将递归自我改进(RSI)扩展到用于长期编码和终端任务的代理工具,使代理能够根据经验改进执行机制。然而,普遍化的 RSI 仍然具有挑战性。首先,评估基准或其子集的不断发展的利用使得很难将可重用的改进与特定于基准的适应区分开来。其次,单轨迹更新可能会将系统性的缺陷与特定于实例的推理和解决方案细节混为一谈,从而产生无法很好地转移到看不见的任务的修改。第三,定位整体Harness内反复出现的行为缺陷很困难,而整体Harness优化可能会纠缠不相关的机制并使归因和验证复杂化。我们提出了 ModularRSI,这是一个用于可推广的Harness演化的基准分离、对比和模块化框架。 ModularRSI 对比同一任务的成功和失败轨迹,并汇总跨任务的证据,以识别反复出现的行为缺陷。它将可进化Harness分解为五个功能模块:代理循环、工具使用、观察管理、上下文管理和任务完成检测。每个模块在有限的修改范围内独立演化,随后进入集成阶段,将演化后的模块组合成统一的工具并解决潜在的冲突。为了支持基准不相交的演化,我们从与下游评估基准不相交的外部来源策划了 2,000 个可执行的演化任务。 TB2.0 和 SWE-Bench Verified 上的实验表明,在未见过的域内和跨域任务上取得了一致的改进,进化后的工具也可以跨不同的基础模型进行迁移。