论文

将交互历史记录转化为执行状态:长视野的运行时层 编码智能体

Turning Interaction History into Execution State: A Runtime Layer for Long-Horizon Coding Agents

智能体系统Agent HarnessAgent Runtime

摘要

长视野 编码智能体 在其轨迹中积累了数百个动作和观察,但该记录中没有任何内容表明哪些观察仍然描述了存储库当前的情况。在做出每个决定之前,模型必须隐式地从原始历史记录中推断出执行状态,当这种推断不充分时,代理会处理过时的文件内容或重新执行结果仍然有效的工作。我们提出了 Ledger,一个确定性的运行时层,它将代理完成的交互提炼成显式的执行状态:已观察到的内容、已修改的内容以及已尝试的内容。 Ledger 将这种状态保存在在线执行分类账中,并将其应用于每个步骤的两个边界。在模型执行之前,通知路径会将紧凑的运行时状态视图附加到提示中;在运行建议的命令之前,治理路径会根据分类账对其进行检查,返回仍然有效的早期结果来代替重新执行并标记可能冗余的重复。该层不添加语言模型调用并包装未修改的代理。在所有 500 个 SWE 基准验证实例中,Ledger 使用 GPT-5 mini 将 Pass@1 从 56.2% 提高到 64.2%,使用 MiniMax M2.5 将 Pass@1 从 75.8% 提高到 81.0%,同时将总成本降低了 28.9% 和 31.8%。附加到 OpenAI Codex 后,它使 Pass@1 提高了 3.4 个百分点,而成本降低了 24.4%。消融将大部分分辨率增益归因于治理,并将大部分效率增益归因于通知,它们的组合表现最佳。我们得出的结论是,长视野智能体所缺乏的不是对其历史的更短的了解,而是对其自身执行状态的明确描述。