论文

SAGE:智能体生态中社交化演化的定量评估

SAGE: A Quantitative Evaluation of Socialized Evolution in Agent Ecosystems

智能体系统Agent任务评测

摘要

自我改进的语言智能体通常是孤立评估的:智能体尝试一项任务,接收反馈,并迭代地完善自己的行为。然而,Agent越来越多地与同行合作,其策略和结果是公开可见的。这就提出了一个尚未得到充分研究的问题:共享经验何时会产生仅靠自我改进无法实现的改进?我们引入了 SAGE(社交代理组进化),这是一种比较两种计算匹配条件的评估框架:SocialEvo,其中来自五个不同模型系列的代理共同进化,可以访问所有同伴的历史记录; SelfEvo,每个智能体接受相同数量的任务尝试,但只能看到自己的过去,这在自我改进智能体研究中是常见的。我们在三个领域实例化 SAGE:开放式机器学习研究、长期经济规划和战略多人游戏,并在多个进化轮次中进行评估。我们发现群体历史并不是一个万能放大器:最强的智能体也不会超过其自我进化上限。然而,当有同行经验时,在自我完善中停滞不前的Agent可以实现重大突破。在竞争环境中,反事实控制表明智能体总体上有所进步,而不是制定针对特定对手的策略。在不同形式的共享历史中,经过过滤的同伴痕迹和反思总结通常优于原始日志,这表明社会收益取决于抽象而不是曝光量。这些发现表明,同伴历史收益是特定于代理的、依赖于竞技场的,并且取决于从公共痕迹中提取可转移知识的能力。

SAGE:智能体生态中社交化演化的定量评估:论文配图
图 1:SAGE 评估框架。固定数量的标记智能体进入两个计算匹配的机制:SocialEvo,其中所有智能体通过访问公共历史通道共同进化,而 SelfEvo,其中焦点智能体独立进化,每轮推出预算相等,但只有私人历史。该比较将收益归因于同行暴露而不是额外的测试时计算。