论文

信念校准优化:用于智能体优化的显式世界模型

Belief-Calibrated Optimization: An Explicit World Model for Agentic Optimization

智能体系统Agent Harness

摘要

LLM 代理的性能取决于冷冻模型周围的支架。改进该脚手架的常见方法是使用编码代理作为优化器:它读取当前分数和跟踪并迭代编辑源,每轮生成一个新的候选者。每个编辑都是根据对环境将如何响应的信念来选择的:出了什么问题,以及哪些更改应该有所帮助。这种信念通常是隐含的。它存在于编码代理对当前调用的推理中,或者隐藏在其参数中,而不是作为写下来的东西。因此,后来的呼叫会看到分数和痕迹,但他们不使用这种信念。我们引入了信念校准优化(BCO),这种方法将信念写下来作为持久的上下文文档,并在评估新候选人时不断修改该文档。生成的文档是一个世界模型:环境如何响应编辑的当前说明。添加到其他标准循环中,BCO 在跨越内存 QA、工具使用 QA、代码即操作应用程序代理和终端代理的五个基准上达到了比仅缺少世界模型的匹配控制更高的训练通过率。每个保留的分裂都存在差距,不用于选择候选人。在目标模型交换(其中冻结模型被替换而脚手架未被替换)之后,选定的 BCO 脚手架会引导我们测试的任务,除非上下文窗口溢出导致任务未完成。然后,离线消融会询问这种差距是否来自世界模型所说的内容。与没有文档或内容被伪造的相同形式副本的预测器相比,给定累积文档的新预测器可以更准确地预测环境将如何响应。比较表明该文档不仅在形式上,而且在其内容中包含可重用的信息。

信念校准优化:用于智能体优化的显式世界模型:论文配图
图1:BCO. 香草(顶部)概览更新了分数和痕量的脚架。 bco保持了一个持久的世界模型,并重复三个步骤:在评价之前预测任务层面的影响(1)、应用和评价机制一级的编辑(2)以及纠正观察到的痕迹的信念(3)。