论文
面向长程任务协同演化的LLM决策与技能库智能体
Co-Evolving LLM Decision and Skill Bank Agents for Long-Horizon Tasks
摘要
长程交互环境是评估智能体技能使用能力的试验场。这类环境要求多步推理、跨多个时间步的多技能串联,以及在延迟奖励和部分可观测条件下的稳健决策。游戏是评估智能体在环境中技能运用的良好试验场。大语言模型(LLM)作为游戏智能体提供了有前景的选择,但由于缺乏跨回合发现、保留和复用结构化技能的机制,它们常常难以保持一致的长程决策。我们提出COSPLAY,一个协同演化框架:LLM决策智能体从可学习的技能库中检索技能以指导行动,同时由智能体管理的技能流水线从智能体的无标注滚动轨迹中发现可复用技能来构建技能库。该框架同时改善决策智能体的技能检索与动作生成学习,而技能库智能体则持续抽取、精炼并更新技能及其契约。跨六个游戏环境的实验表明,采用8B基座模型的COSPLAY在单人游戏基准上相对四个前沿LLM基线取得超过25.1%的平均奖励提升,同时在多人社交推理游戏中保持竞争力。
