论文

Agent可塑性:衡量执行经验带来的自我改进

Agent Plasticity: Measuring Self-Improvement Through Experience

智能体系统上下文与知识记忆Agent任务评测智能体自我改进Agent记忆

摘要

人工智能Agent越来越多地在可以诊断故障并通过经验进行改进的环境中运行,但现有的评估主要衡量Agent在固定时间点可以做什么,而不是学习的效率。评估自我改进需要回答三个问题:未来的表现是否会改善并推广到超越促进学习的互动?获得新能力的效率如何;自我完善的过程在哪里失败了?为了回答这些问题,我们在受控环境中研究自我完善,在该环境中,智能体将过去的经验分摊为可重用的产物,并由未来的实例继承。在每个检查点,我们都会衡量训练和保持环境交互的表现,同时考虑学习成本。我们引入了Agent可塑性,即Agent将经验转化为未来绩效收益的效率。在多种环境中,尽管学习机会相当,但前沿模型表现出截然不同的改进轨迹。有些人取得了实质性和持久的收益,而另一些人则仍然接近或低于其初始表现,并且训练制度内的收益通常只能部分转移到分布外的条件下。端点能力和采集效率也存在差异:最终表现最佳的Agent不一定是改进最有效的Agent。通过改进循环追踪失败进一步揭示了不同的候选瓶颈。可塑性较低的Agent通常无法重用相关产物,而更多的可塑性Agent尽管重用了相关产物,但仍可能失败,这表明产物质量、泛化或应用方面的局限性。评估自我改进的Agent不仅需要衡量他们能做什么,还需要衡量他们如何有效地通过经验变得更好。