论文

HumanStudy-Bench:面向参与者模拟的 AI 智能体设计

HumanStudy-Bench: Towards AI Agent Design for Participant Simulation

智能体系统Agent任务评测

摘要

大语言模型(LLM)越来越多地用作社会科学实验中的模拟参与者,但它们的行为通常不稳定并且对设计选择高度敏感。先前的评估经常将基础模型功能与实验实例化混为一谈,从而模糊了结果是否反映了模型本身或代理设置。相反,我们将参与者模拟框架为完整实验协议上的代理设计问题,其中代理由基本模型和编码行为假设的规范(例如参与者属性)定义。我们引入了 HUMANSTUDY-BENCH,这是一个基准测试和执行引擎,它协调基于 LLM 的代理,通过过滤-提取-执行-评估管道重建已发表的人体实验,重放试验序列并在共享运行时运行原始分析管道,从而端到端地保留原始统计程序。为了评估科学推理层面的保真度,我们提出了新的指标来量化人类和代理行为的一致性。我们实例化了 12 项基础研究作为这个动态基准的初始套件,涵盖个人认知、策略互动和社会心理学,并涵盖 6,000 多项人类样本试验,参与者范围从 10 名到 2,100 多名参与者。

HumanStudy-Bench:面向参与者模拟的 AI 智能体设计
图1:HumanStudy-Bench 引擎概览。给定已发表的受试者研究,该引擎提取参与者画像、实验设计、统计检验与人类 ground-truth 结果,并将其转化为可复用的仿真环境。从业者通过 agent 规范接入基于 LLM 的智能体,在重构的实验中运行它们,并获得量化其与异质研究中人类效应一致性的 Probability Alignment Score。