论文

SocietyBench:预测反事实的社会世界演变

SocietyBench: Forecasting Counterfactual Social-World Evolution

模型评测基准与评测资源

摘要

大语言模型 (LLM) 以及构建在它们之上的代理现在主要针对它们是否可以完成任务进行基准测试——修复错误、驱动浏览器、操作 GUI。一种互补的社交能力,即模型对真实社会事件展开方式的理解和预测程度,几乎没有被测量过。我们引入了 SocietyBench,这是一种端到端基准测试,它采用单行事件主题,收集五个平台上的网络新闻和社交媒体帖子,将它们提炼成一个日期索引的时间线,将事实事件和公众意见层分开,然后将该时间线上的每个截止日期转变为经过审计的预测问题库。问题在两个正交的 100 点轴上评分:概率校准和时间准确性。在任何模型看到时间线之前,三阶段过程会替换每个命名实体,并按每个事件常量移动每个日期,将真实的弧线转变为反事实的社交世界——结构与所发生的情况相同,但剥离了模型可以与 预训练 内存匹配的表面标签。在中英文版本的五个异质事件和 125 个预测点上,六个前沿 LLM 中最强的仅达到 75.0(满分 100),而锚点则为 50。这两个轴是分开的:模型可以是校准强但时间弱的,或者相反。基于共享基础模型构建的三个代理框架未能在该基础上进行改进,并且两个无模型启发式方法跟踪每个 LLM。每个事件的差距在单个轴上达到 21.4 点,这是我们评估多个事件而不是一个事件的主要论点。所有匿名时间表、题库、真值 和评分代码均已发布。