论文
边行动边学习:在线终身学习代理的技能增强测试时共同进化框架
Learning While Acting: A Skill-Enhanced Test-Time Co-Evolution Framework for Online Lifelong Learning Agents
摘要
终身学习对于在动态、交互式环境中运行的 大语言模型 (LLM) 代理至关重要。然而,现有的长期任务的终身学习代理通常依赖于在推理过程中使用静态参数检索离散技能或过去的经验,这阻止了它们像人类学习者一样不断内化测试时的反馈。为了弥补这一差距,我们提出了技能增强的测试时协同进化(\texttt{LifeSkill}),这是一种用于在线终身学习代理的两阶段强化学习框架。具体来说,我们设计了验证者引导的技能学习,通过根据多个技能条件策略执行轨迹的平均验证者成功程度奖励候选技能,解决技能提取缺乏直接监督的问题,鼓励模型生成对解决任务有用的技能,而不仅仅是在文本中看似合理的技能。此外,我们引入了在线技能内化,它通过将技能条件轨迹转化为奖励信号,在测试时交互过程中不断改进策略模型。这使得代理能够直接将推理能力内化到其参数中,避免经验检索的上下文膨胀。 LifelongAgentBench 上的实验表明,与现有的终身代理基线相比,LifeSkill 将平均性能提高了 7 个绝对点。