论文
面向LLM智能体规划的自进化世界模型
Self-Evolving World Models for LLM Agent Planning
摘要
世界模型为长程LLM智能体提供有原则的前瞻方式:执行前预测动作后果。但不可靠的前瞻可被忽视、误用甚至损害下游决策。我们引入WorldEvolver:自进化世界模型框架——在保持下游智能体与全部模型参数冻结的同时修订其部署时上下文。WorldEvolver集成三个模块:(i) 情节记忆——经基于检索的仿真利用真实动作转移;(ii) 语义记忆——从预测-观察失配中提取持久的启发式规则;(iii) 选择性前瞻——在整合进智能体推理上下文前过滤低置信预测。在ALFWorld与ScienceWorld上评估:三个骨干上取得最高预测准确率、在下游智能体成功率上领先其他世界模型基线——表明测试时记忆修订同时增强预测与决策。
