论文
大语言模型智能体的经验规则与策略联合学习
Joint Learning of Experiential Rules and Policies for Large Language Model Agents
摘要
对多步交互环境中的LLM智能体——关键挑战是有效利用积累的交互经验。既有工作通常把经验的两种用途分开:把经验留在模型外作为自然语言规则供后续提示——或用轨迹与反馈更新模型参数。前者易解释但可能与演化的策略脱节;后者更广泛地改进策略——但在稀疏奖励设定下仅对局部错误提供有限纠正。我们提出面向LLM智能体的经验规则与策略联合学习(JERP)——从相同交互轨迹同时更新长期经验规则池与策略。决策时——JERP检索任务相关规则——把它们连同交互历史一起条件化智能体。每episode后——它用收集的轨迹既优化策略——又经比较当前rollout与参照成功轨迹修订规则池。这种耦合保持规则池与演化策略对齐——同时让稳定有效的行为逐渐被吸收进模型本身。AlfWorld与WebShop上的实验表明JERP在复杂交互任务的决策性能上带来一致增益。
