论文
缩小一致性差距:让Agent从经验中学习保持执行稳定
Closing the Consistency Gap: Self-Evolving Agents That Learn to Stay on Course
摘要
由大型语言模型 (LLM) 驱动的智能体平均而言可以准确,但在生产中并不可靠,这种差异已被观察到,但在很大程度上仍未得到解决。当同一任务被赋予五次时,使用 GPT-4.1 的 AppWorld 基准的 ReAct 智能体在所有五次运行中只有 53% 的成功率,尽管其每次运行的平均通过率是 77%。我们将这个 24 点的差距称为一致性差距,我们认为解决这个问题是部署值得信赖的 AI 智能体的先决条件。我们提出了一种自我进化的智能体框架,通过识别智能体轨迹中不稳定、低一致性的步骤并将其转换为智能体在未来运行中可以利用的情景记忆来缩小这种差距。其核心是一致性分析器,可查明轨迹可能在执行中翻转的位置和原因,以及指南生成器,可将诊断结果转换为有针对性的指南,提交到内存并注入到未来执行类似任务的智能体中。在使用 ReAct/GPT-4.1 的 AppWorld 上,我们的框架将所有五次运行中成功的任务分数在相同任务评估上提高了 16 分,在相似任务泛化上提高了 13 分。