论文

通过技能进化实现自我进化的具体代理

Self-Evolving Embodied Agents via Skill-Harness Evolution

智能体系统Agent Harness

摘要

实体代理越来越多地构建为围绕基础模型的系统,其中性能不仅取决于模型权重,还取决于模型周围的技能、上下文、操作接口和执行工具。虽然监督 微调 和强化学习可以使代理适应新环境,但它们需要额外的数据、奖励和训练运行;与此同时,许多免训练的以代码为中心的方法依赖于可编程机器人 API,而这些 API 在固定接口设置中可能不可用。我们提出了 SHAPER,这是一种用于免训练体现适应的自我进化框架,它可以保持模型参数冻结,并通过目标环境的执行轨迹来发展可重用技能和上下文代码工具,从而改进非参数代理系统。在 SHAPER 中,相同的冻结模型可以充当规划器和优化器,从而改进其外部技能和上下文代码利用,而无需更新参数。我们在 VLABench 和 ESI-Bench 上评估 SHAPER,涵盖具有不同底层操作接口的具体代理,并与纯执行、受监督的 微调 以及测试时间扩展基线(例如无验证者选择和投票)进行比较。我们的结果表明,当 模型训练 昂贵、不可用或不受欢迎时,技能和工具优化是实现自我进化的具体代理的实用途径。