论文

面向LLM智能体规划的自进化世界模型

Self-Evolving World Models for LLM Agent Planning

上下文与知识记忆Agent记忆

摘要

世界模型为长程LLM智能体提供有原则的前瞻方式:执行前预测动作后果。但不可靠的前瞻可被忽视、误用甚至损害下游决策。我们引入WorldEvolver:自进化世界模型框架——在保持下游智能体与全部模型参数冻结的同时修订其部署时上下文。WorldEvolver集成三个模块:(i) 情节记忆——经基于检索的仿真利用真实动作转移;(ii) 语义记忆——从预测-观察失配中提取持久的启发式规则;(iii) 选择性前瞻——在整合进智能体推理上下文前过滤低置信预测。在ALFWorld与ScienceWorld上评估:三个骨干上取得最高预测准确率、在下游智能体成功率上领先其他世界模型基线——表明测试时记忆修订同时增强预测与决策。

面向LLM智能体规划的自进化世界模型:论文配图
图 1:不同世界模型的对比。冻结 (a) 和离线调整 (b) 世界模型向代理提供预测,无需根据部署时交互进行修改;自我演化 (c) 世界模型累积已实现的转变,并通过预测结果与观察结果之间的不匹配而演化。