论文
MiroBench:现实世界讨论的代理模拟中的现实主义基准
MiroBench: Benchmarking Realism in Agentic Simulation of Real-world Discussions
摘要
LLM 代理越来越多地用于模拟现实世界的交互,但尚不清楚模拟行为是否保留了真实人类行为的内容模式和交互动态。现有的评估仍然分散,这使得比较系统或衡量进展变得困难。在本文中,我们重点关注 Reddit 的讨论,将其作为评估现实社会模拟的具体第一步。 Reddit 主题提供公开的、基于主题的多方互动,人们可以在其中分享经验、辩论、寻求建议、表达情感,并对产品、事件和社会问题做出集体回应。这些讨论为更广泛的社会行为提供了一个可观察的窗口,使它们成为测试 LLM 代理是否不仅可以重现流畅的文本,而且可以重现真实在线社区的分布模式和交互动态的有用设置。我们推出了 MiroBench,这是一个基于 4,292 个真实 Reddit 线程构建的 Reddit 讨论模拟基准。 MiroBench 使用统计测试来比较四个主要方面的生成讨论和真实讨论:重复和语义一致性、叙述内容、毒性和攻击性以及结构复杂性。跨五个领域和五个模型的实验表明,当前的模拟器在分布上仍然与真实的 Reddit 线程不匹配,而基于提示的轻量级改进程序仅提供有限的收益。 MiroBench 为测量、诊断和提高基于 LLM 的社会模拟的真实感提供了具体的基准。