论文

递归利用自我完善

Recursive Harness Self-Improvement

智能体系统Agent Harness

摘要

在模型-Harness协同演化下,Harness不仅是推理时间支架,而且是数据生成组件,其执行轨迹可以塑造未来的基础模型。这激发了Harness在环学习:优化Harness以实现即时代理性能和用于未来 模型训练 的跟踪质量。然而,不断更新提供商构建的脚手架成本高昂且劳动密集型。因此,我们研究以特定于任务的方式优化用户构建的Harness是否可以提高执行跟踪质量,同时保持计算轻量级并且仅需要几次更新迭代。为此,我们引入了递归Harness自我改进(RHI),它将Harness表示为代理循环的提示级规范,并使用其自身修订历史记录的成对反馈对其进行迭代改进。在涵盖定量金融、机器人和制药的 30 个合成机器学习研究任务中,几次 RHI 迭代足以大幅提高低推理努力代理的性能上限,超过相应的最大推理努力设置,同时将推理成本降低高达 60%。我们表明,这些收益主要来自于通过更有效的代理间信息流而不是更长的推理跟踪来改进特定于任务的上下文管理。最后,我们将这种行为形式化为 RHI 隐式优化目标的信息论假设,建议 RHI 作为模型-利用协同进化范式中持续学习的实用算法。