论文

BehaviourBench:行为科学任务的基准模型

BehaviorBench: Benchmarking Foundation Models for Behavioral Science Tasks

模型评测基准与评测资源

摘要

基础模型越来越多地应用于心理学、社会学和经济学等行为科学领域。虽然这些模型在调查反应预测和人体实验模拟等个别任务中显示出希望,但对于它们在不同行为科学任务、背景和人群中的表现仍然没有系统的了解。我们引入了BehaviorBench,这是一个综合基准测试,可根据四个核心功能评估基础模型:(1)行为预测和模拟,(2)战略决策,(3)主体特质推断,以及(4)行为知识应用。至关重要的是,BehaviorBench 在个体和分布层面评估模型输出,不仅捕获每个受试者的准确性,而且捕获群体水平的一致性,这是行为有效性的基本要求。利用BehaviorBench中的任务,我们进一步开发了Be.FM-1.5,扩展了根据行为数据进行微调的Be.FM行为基础模型系列。我们的结果揭示了相当大的差距:专有的通用模型擅长个人层面的预测和知识密集型任务,而行为基础模型,根据行为数据进行微调,实现了更强的分布一致性。值得注意的是,Be.FM-1.5 在分布指标上领先,并且在个人层面指标上保持竞争力,这表明适当的行为适应可以缩小差距。我们的结果强调了分布评估的重要性,将BehaviorBench建立为开发和评估行为一致的人工智能系统的基础,并证明了Be.FM-1.5在广泛的行为科学研究中的潜力。我们的BehaviorBench和Be.FM-1.5模型可以通过https://umich-foreseer.github.io/behaviorbench/访问。