论文

ConflictGuide:当竞争行为变得可见时,自动研究会得到改进

ConflictGuide: AutoResearch Improves When Competing Behaviors Are Made Visible

智能体系统Agent Harness

摘要

在设计机器学习模型时,理想的属性常常处于紧张状态:改善一种行为可能会损害另一种行为,因此任务进展可能取决于冲突的缓解。基于大语言模型的自动研究系统迭代地编辑模型代码并根据标量任务绩效反馈保留编辑,在很大程度上忽略了这种权衡。我们发现标量反馈支持搜索早期的广泛探索,但它并没有揭示编辑如何影响竞争行为。在匹配预算实验中,当任务收益减少时引入竞争行为反馈会增加改善行为并维持超越纯标量平台的进展的建议的份额。要获得给定模型的反馈,需要识别其竞争行为并设计探针来测量它们。为了使竞争行为反馈具有可操作性,我们引入了 ConflictGuide。其可重用的 ConflictGuide-Skill 将基于文献的分类法与特定于模型的证据相结合,以识别竞争行为并为代码Agent指定要作为指标实施的探针。进化分两个阶段进行:第一阶段通过任务反馈进行探索;第二阶段使用探针反馈来引导提案走向缓解冲突,并且仅当探针表明充分缓解时才保留边际增益编辑。在五个不同的模型系列中,相对于纯标量 AutoResearch,ConflictGuide 分别将任务和冲突相关错误减少了 28% 和 14%,并将收益扩展到其他代码Agent。