论文

CoMAP:面向LLM智能体的共同演化世界模型与智能体策略

CoMAP: Co-Evolving World Models and Agent Policies for LLM Agents

智能体系统Agent 架构与控制循环

摘要

为语言代理配备世界模型,使它们能够预测环境动态并在执行之前评估候选操作。然而,现有的文本世界模型通常在训练后是固定的,这使得它们无法适应由不断发展的智能体引起的策略状态动作分布。同时,代理改进方法通常依赖于外部奖励或验证者,限制了它们在现实交互环境中的适用性。在本文中,我们提出了 COMAP,这是一种通过闭环交互共同演化文本世界模型和代理策略的新颖框架。在每个决策步骤中,世界模型预测候选动作的未来状态反馈,并且代理通过估计该反馈的可靠性并相应地改进其动作来执行未来感知反射。然后,生成的策略轨迹用于通过自蒸馏来更新世界模型,使其能够更好地匹配代理不断变化的交互分布。在具体的任务规划、网络导航和工具使用基准方面,COMAP 始终优于竞争基准,例如,与 Qwen3-4B 相比,相对提高了 16.75%。进一步的分析表明,协同进化循环随着时间的推移提高了世界模型的预测准确性,并导致更有效的长期决策。我们的代码位于:https://github.com/loyiv/CoMAP。

CoMAP:面向LLM智能体的共同演化世界模型与智能体策略:论文配图
图 1:LLM 代理的世界模型和代理策略共同演化的概念图。