论文

失败早于漂移:LLM Agent群体中的价值社会动态

The Failure Happens Before the Drift: The Social Dynamics of Values in LLM Agent Societies

模型评测模型行为与机制分析

摘要

基于大语言模型(LLM)的智能体越来越多地用作社会科学研究中人类参与者的智能体,但目前尚不清楚它们是否能够忠实地模拟多样化且相互冲突的人类价值体系。我们提出了一个基于世界价值观调查(WVS)的模拟框架,在该框架中,具有不同沟通方式的不同文化的主体参与纵向的、充满价值的讨论。在涉及 1,200 个角色、15 个主题和三个模型(GPT-4o、Gemini-2.5-Flash 和 Gemma-4-E4B)的大约 4,000 个对话中,我们评估了价值忠实度、价值漂移和对话现实性。我们发现,超过 50\% 的角色从一开始就未能表达其指定的 WVS 配置文件,而 2-7\% 的角色在重复对话后会出现偏差。消除人口统计细节的消融提高了某些模型的可信度,但不会改变更广泛的趋势:模拟值分布仍然系统性地偏离指定的 WVS 配置文件。与人类讨论相比,模拟对话显示出风格一致性和语义多样性之间不同的权衡,通常会产生内容多样但风格重复的交流。这些发现表明,当前的大语言模型智能体可以产生看似合理的对话,但随着时间的推移,在代表和保留不同的人类价值概况方面仍然有限。

失败早于漂移:LLM Agent群体中的价值社会动态:论文配图
图 1:所提出的基于 WVS 的多主体模拟框架的概述,其中受文化条件影响的 LLM 角色参与不同主题的重复价值驱动讨论,并评估价值忠诚度、价值漂移和对话现实性。