论文
PatchWorld:代理环境的可执行世界模型的无梯度优化
PatchWorld: Gradient-Free Optimization of Executable World Models for Agent Environments
摘要
交互式文本代理的世界模型通常必须仅从观察动作轨迹中学习。具体来说,环境在每次操作后返回文本观察,但不会暴露 真值 潜在状态,也不会暴露可检查的转换模型。如何在这个黑盒设置中将可执行代码作为世界模型进行预测和代理决策,仍然存在研究空白。我们引入了 PatchWorld,一个无梯度框架,通过反例引导的代码修复将离线轨迹转化为可执行的 Python 世界模型。 PatchWorld 不是用黑盒模型预测下一个观察结果,而是引入符号信念状态程序,其动作更新可以被检查、重播和本地修补。在七个 AgentGym 环境中,PatchWorld-Simple 在评估的方法中获得了最高的基于代码的决策得分(实时一步前瞻中的宏观成功率为 76.4%),匹配或超过基于 LLM 的前瞻,同时在世界模型预测模块本身内不调用 LLM 调用。我们进一步发现,人类指定的残余记忆偏差提高了表面观察的保真度,但削弱了代理决策的效用。这揭示了可执行世界模型的权衡,因为提高观察保真度可能会以牺牲动作判别动态为代价,反之亦然。代码可在 https://github.com/HKBU-KnowComp/PatchWorld 获取。