论文
LiveCultureBench:面向大语言模型动态社会仿真的多智能体多文化基准
LiveCultureBench: a Multi-Agent, Multi-Cultural Benchmark for Large Language Models in Dynamic Social Simulations
摘要
大语言模型(LLM)日益被部署为自主智能体,但评估主要聚焦任务成功,而非文化适宜性或评估者可靠性。我们提出 LiveCultureBench,一个多文化动态基准,把 LLM 作为智能体嵌入模拟小镇,同时评估任务完成度与社会文化规范遵从度。该仿真把小城市建模为位置图,其上的合成居民拥有多样化的人口与文化特征。每个回合给一名居民分配日常目标,其他居民提供社会情境。基于 LLM 的验证器就违规与任务进展生成结构化判断,我们将其聚合为刻画任务-规范权衡与验证器不确定性的指标。借助 LiveCultureBench 跨模型与文化特征,我们研究(i)LLM 智能体的跨文化稳健性,(ii)它们如何在效能与规范敏感性之间权衡,以及(iii)LLM 作为裁判的评估何时对自动基准可靠、何时需要人类监督。