论文

Polaris:从执行经验中改进Gödel智能体的策略代码

Polaris: A Gödel Agent Framework for Small Language Models through Experience-Abstracted Policy Repair

智能体系统Agent 架构与控制循环

摘要

哥德尔代理实现递归自我改进:代理检查自己的策略并跟踪,然后在经过测试的循环中修改该策略。我们引入了 Polaris,一种用于紧凑模型的哥德尔代理,它通过经验抽象执行策略修复,通过分析、策略形成、抽象和保守检查的最小代码补丁修复的结构化循环将故障转化为策略更新。与响应级别自我校正或参数调整不同,Polaris 使用小的可审计补丁来进行策略级别更改,这些补丁会保留在策略中,并在每个基准测试中未见过的实例上重复使用。作为循环的一部分,代理进行元推理:它解释其错误,提出对其自身策略的具体修改,然后更新策略。为了实现累积策略细化,我们引入了经验抽象,它将失败提炼为紧凑的、可重用的策略,并转移到未见过的实例。在 MGSM、DROP、GPQA 和 LitBench(涵盖算术推理、组合推理、研究生水平问题解决和创意写作评估)上,配备 Polaris 的 70 亿参数模型在基本策略和竞争基线上取得了一致的进步。