论文
RRSI:通过正则约束改进Agent Harness的递归优化
RRSI: Regularized Recursive Self-Improvement of Agent Harnesses
摘要
LLM 代理的能力在很大程度上通过其工具(即围绕冻结骨干模型的提示、控制流、工具、内存和上下文管理)得到放大。最近的方法通过迭代地提出和选择代理工具的组件级编辑来日益自动化该过程,实际上在代理系统级别建立了一种递归自我改进(RSI)的形式。然而,这种递归进化可能会因记忆训练任务而过度拟合,从而显示出较大的分布内增益,而这些增益在分布外基准上会缩小甚至消失。我们引入了 Agent Harnesses 的正则化递归自我改进(RRSI),它将正则化的原理通过限制进化候选提案和选择来融入到 Harness 的自我改进中。提议者以临时退火的预算运作,限制了候选者可以捆绑的编辑数量,并且它鼓励基于进化历史的未探索的轨迹。选择器配备了批评者和修剪器:批评者筛选特定于基准的建议,而修剪器则删除太小、太昂贵或不再有用的更改。总的来说,这些约束有利于可重用的代理机制,而不是特定于基准的代理机制,甚至噪音。在涵盖编码、代理工作空间和工程设计任务的八个基准中,RRSI 在其演变所针对的分割上获得了高达 14.1 分,在五个分布外基准上获得了高达 4.7 分,同时生成的工具比非规范化演变所运行的策略词元少了 30%。代码可从此 https URL 获取,项目页面就是此 https URL。