论文

超越下一次观察预测:用于顺序决策的代理创作的世界建模

Beyond Next-Observation Prediction: Agent-Authored World Modeling for Sequential Decision Making

智能体系统Agent 架构与控制循环

摘要

最近对 大语言模型 (LLM) 智能体的世界建模的研究通常将学习目标制定为下一个观察预测。然而,这个目标将监督与转变所揭示的内容联系起来,这可能会忽略与代理当前决策最相关的动态。为了弥补这一差距,我们提出了代理创作的世界建模(AAWM),这是一种根据政策自身决策需求构建监督的训练程序。具体来说,在每个状态下,代理都会在采取行动之前确定需要了解的环境信息。这些需求推动了跨轨迹的相关转变证据的检索,然后将其合成为捕获面向决策的动态而不是重建下一个观察的训练目标。这使训练目标与政策采取行动之前所需的动态保持一致,而不是与下一次观察的内容保持一致。实验结果验证了 AAWM 在多种环境和训练设置中的有效性。这些结果表明,决策感知世界模型目标提供了比下次观察预测更有效的学习信号。