论文
Agentopia:智能体社会中的长期生活模拟和学习
Agentopia: Long-Term Life Simulation and Learning in Agent Societies
摘要
人类从社会生活中学习。使用 LLM 驱动的代理来模拟这个过程代表了一个有前途的研究方向,自然而然地提出了一个问题:LLM 是否可以从这种模拟的社会经验中学习,以更好地理解和复制人类行为。然而,之前的智能体社会模拟通常以天为单位进行,限制了社会互动的深度和长期增长。在本文中,我们研究主体社会中的长期生活模拟和 LLM 学习,有两个目标:(1)研究终身模拟中出现的社会行为,(2)通过多年的模拟社会经验发展 LLM 中的拟人化能力,特别是社会生活中的智力。具体来说,我们提出了 Agentopia,这是一个用于多智能体社会中长期生活模拟的综合框架,其中 100 个智能体在 10 个模拟年中自主地追求个人成长、发展社会关系并满足他们的需求和目标。我们定义生命奖励来反映人类福祉,并利用该奖励通过拒绝采样来训练 LLM。大量实验表明,智能体表现出丰富的新兴社会行为。此外,生命奖励训练有效地增强了底层的 LLM,从而改善了模拟中的代理福祉,并推广到下游角色扮演基准,提高了 15.6%。