论文

XSkill:多模态智能体从经验与技能中持续学习

XSkill: Continual Learning from Experience and Skills in Multimodal Agents

智能体系统上下文与知识记忆Agent SkillsAgent记忆

摘要

多模态智能体现在能够借助多样工具处理复杂推理任务,但在开放式环境中仍受制于低效的工具使用与僵化的编排。一个核心挑战是让此类智能体无需参数更新,就能通过学习过往轨迹持续改进。我们识别出对这一目标至关重要的两种互补的可复用知识:经验,为工具选择与决策提供简明的动作级指导;技能,为规划与工具使用提供结构化的任务级指导。为此,我们提出XSkill,一个让多模态智能体从经验与技能中进行持续学习的双流框架。XSkill将知识抽取与检索都锚定在视觉观测上。在积累阶段,XSkill通过视觉锚定的摘要与跨rollout批判,从多路径rollout中蒸馏并整合经验与技能。在推理阶段,它检索这些知识并适配当前视觉情境,同时将使用历史反馈回积累环节,形成持续学习闭环。在覆盖多领域的五个基准、四种骨干模型上的评估显示,XSkill持续且大幅超越仅用工具与基于学习的两类基线。进一步分析表明,两种知识流在影响智能体推理行为方面发挥互补作用,并展现出更优的零样本泛化能力。

XSkill:多模态智能体从经验与技能中持续学习:论文配图
图 1:使用和不使用 XSkill 的多模态任务的推理轨迹比较。基线代理(左)由于视觉语义差距而失败,忽略了纠正倒置图像或隔离小物体。相比之下,XSkill(右)回忆相关经验并将其与结构化技能片段联系起来。通过上下文感知适应,代理生成一个涉及轮换和裁剪的扎实执行计划,从而成功识别。