论文

面向长程任务协同演化的LLM决策与技能库智能体

Co-Evolving LLM Decision and Skill Bank Agents for Long-Horizon Tasks

智能体系统上下文与知识记忆Agent SkillsAgent记忆

摘要

长程交互环境是评估智能体技能使用能力的试验场。这类环境要求多步推理、跨多个时间步的多技能串联,以及在延迟奖励和部分可观测条件下的稳健决策。游戏是评估智能体在环境中技能运用的良好试验场。大语言模型(LLM)作为游戏智能体提供了有前景的选择,但由于缺乏跨回合发现、保留和复用结构化技能的机制,它们常常难以保持一致的长程决策。我们提出COSPLAY,一个协同演化框架:LLM决策智能体从可学习的技能库中检索技能以指导行动,同时由智能体管理的技能流水线从智能体的无标注滚动轨迹中发现可复用技能来构建技能库。该框架同时改善决策智能体的技能检索与动作生成学习,而技能库智能体则持续抽取、精炼并更新技能及其契约。跨六个游戏环境的实验表明,采用8B基座模型的COSPLAY在单人游戏基准上相对四个前沿LLM基线取得超过25.1%的平均奖励提升,同时在多人社交推理游戏中保持竞争力。

面向长程任务协同演化的LLM决策与技能库智能体:论文配图
图 1:COS-PLAY 概述。 COS-PLAY 是一个将游戏玩法与技能学习相结合的多智能体共同进化框架。它由决策代理(橙色框)、技能库代理(红色框)和技能库(紫色框)组成。决策代理通过检索技能、更新意图和选择行动来与游戏交互。每集结束后,技能库代理会分割轨迹、学习技能合同、添加新技能,并通过细化、合并、拆分或退役来更新现有技能。这个循环使代理能够从先前的经验中获得可重用的技能,并不断改进其策略。