智能体行为即代码:高效且稳健的LLM智能体具有编程规范
Agent Behavior as Code: Efficient and Robust LLM Agents with Programmatic Specifications
摘要
基于基础模型(FM)的AI 智能体已展现出执行复杂开放式任务的强大能力。然而,它们在实践中面临一些常见的挑战:(a)即使对于语义相似的任务,智能体的行为也可能发生巨大偏差,导致灾难性的传播错误; (b) 由于 FM 调用导致高成本和延迟,每当使用不同输入重复执行任务时都会完全重复; (c) FM 有限的上下文和指令跟踪能力限制了智能体管理不断增长的执行上下文和遵循复杂计划的能力。我们将 $\textbf{A}$gent $\textbf{B}$ehavior 引入为 $\textbf{C}$ode $\textbf{Agent}$ (ABCAgent),它使用符号程序(例如,具有潜在神经功能的 Python 代码)来完全指定智能体在运行时的行为,并使用强大的 FM 智能体编辑该程序以实现灵活性。因此,行为是在没有过早变量绑定的情况下指定的,并且其执行是确定性的。我们在六个智能体基准测试上评估 ABCAgent,其中两个基准测试是为了测试派生程序泛化到其所编写的任务变体的效果如何。 ABCAgent 与 GAIA 和增强型 GAIA 上的模型匹配神经智能体相匹配,并在稳健性和长控制流至关重要的方面超越了它:GSM-Symbolic ($p = 0.001$) 上的 98.3% 对比 97.3%,$τ^2$-bench ($p = 0.0001$) 电信域上的 71.9% 对比 47.4% $\mathrm{Pass}^4$,以及更多写入记录在我们的控制流增强型 WorkArena 基准测试中,每个循环长度都正确。对于更多参数化的任务族,ABCAgent 在效率上也明显优越。在无需编写新程序的情况下,ABCAgent 可以解决 92.6% 的 GSM-Symbolic 实例和 20.1% 的增强型 GAIA 变体,从而在 GSM-Symbolic 上降低 $5.2\times$ 延迟,降低 $7.0\times$ 成本,在增强 GAIA 上降低 19% 成本,在 $τ^2$-telecom 上降低 $9.5\times$ 智能体延迟。