论文
SPyCE:多模式代理的技能策略协同进化
SPyCE: Skill-Policy Co-evolution for Multimodal Agents
摘要
使用图像进行思考的多模式代理会迭代地操纵视觉证据并跨多个步骤调用工具。现有的强化学习方法将轨迹减少为标量奖励,迫使策略在每项新任务中从头开始发现可重用的工具使用模式;基于记忆的替代方案保留了过去的经验,但它们依赖于测试时检索,而不更新策略以吸收该经验中的可重用模式。我们的主要见解是,多模态推理轨迹应该被提炼成可重用的技能,在训练过程中与策略共同发展,而不是作为奖励消耗或从静态存储中检索。为此,我们提出了 SPyCE(技能-策略协同进化),这是一个将轨迹提炼成分层技能库并在整个强化学习过程中更新的框架。执行技能捕获本地视觉操作,而工作流程技能编码协调工具使用的高级先验。在训练期间,策略模型以检索到的技能为条件来指导其执行轨迹,而技能库则使用策略生成的有价值的执行轨迹来发展。这创建了一个闭环,其中改进的策略产生更好的技能,而不断发展的技能库反过来又为策略的采样轨迹提供了更强大的先验。八个基准测试的实验表明,SPyCE 始终优于基于 RL 和基于内存的基准。进一步的分析表明,分层技能设计和共同进化机制对我们的设计至关重要。这些结果表明联合技能策略优化是构建有能力的多模式代理的有前途的范例。