论文

代理编辑世界模型:重新思考 LLM 代理的世界建模

Agent-Editing World Model: Rethinking World Modeling for LLM Agents

智能体系统Agent 架构与控制循环

摘要

大语言模型 (LLM) 的最新进展使智能体能够跨不同环境处理长期任务。为了进一步提高智能体的性能,现有的语言世界模型通常会预测环境观察结果,但当存在真实反馈时,重建高熵、依赖于执行的工具响应的价值有限。与此同时,智能体遭受\emph{任务状态污染},即不受支持的假设和过时的计划在历史中持续存在并扭曲随后的决策。我们提出了 \textbf{代理编辑世界模型(AEWM)},它模拟推理和行动如何塑造未来的任务进度,而不是模拟工具响应。 AEWM 将 \textbf{Action Judge} 与 \textbf{State Revision} 结合起来,以区分 \textsc{Critical}、\textsc{Exploratory} 和 \textsc{Noisy} 决策,以编辑噪声推理 - 来自相同观察到的历史的动作延续。 \textbf{EditAct} 将这些功能与实际执行相结合,直接改变后续决策背后的状态,而不仅仅是提供批评。我们通过中期训练和监督微调来跨搜索、终端和软件工程训练 AEWM。 AEWM 在我们的 Action Judge 基准测试中达到了 70.5% 的宏观 F1,比最强的前沿基线高出 10.6 个点。在六个基准测试和三个代理主干中,EditAct 将平均分数比最强基准提高了 3.2--6.7 分。此外,在经过验证的 EditAct 轨迹上进行拒绝采样微调(称为 \textbf{AEWM-RFT}),在没有在线 AEWM 指导的情况下,在三个域中比 Self-RFT 提高了 2.2--2.6 个点。