论文

语言模型智能体的自编程执行

Self-Programmed Execution for Language-Model Agents

智能体系统Agent 架构与控制循环Agent Harness

摘要

现有语言模型代理的核心是一个固定的协调器程序,负责连续轮之间的状态转换。本文介绍了自编程执行(SPE),这是一种代理架构,其中模型完成本身就是编排器程序,并且该工具评估该程序但不强加自己的编排策略。我使用代理机器来形式化这个想法:SPE 状态是模型完成可以加载机器嵌入式副本的任何状态的状态,这意味着它不受固定的回合编排策略的约束。在实践中实现 SPE 并非易事,因为相同的数据既是模型上下文又是可执行程序。因此,我介绍了 Spell,这是一种基于 Lisp 的语言,程序可以在其中编辑和重新评估自身,并且构建模型调用等有效表达式,以便重新评估已编辑的程序不会重播其副作用。对未经过 SPE 或 Spell 训练的现有模型进行的实验表明,前沿模型可以在这种情况下运行并完成具有挑战性的代理任务。这些结果展示了 LM 如何在没有任何固定编排策略的情况下充当代理,并且提出了一个问题:经过自编程执行训练的模型可以学习哪些自编排策略。代码可在 https://github.com/lukejoconnor/spell 获取。

语言模型智能体的自编程执行:论文配图
图5:中等努力GPT-5.4编码任务的平均缓存/未缓存输入与输出token统计。