论文
人工社会基准:综合研究的验证框架
Artificial Societies Benchmark: A Validation Framework for Synthetic Research
摘要
综合调查可以重现平均答案,同时歪曲人们的差异、他们的答案彼此之间的关系,或者他们对条件变化的反应。我们引入人工社会基准来帮助研究人员评估合成群体是否支持他们的预期分析。该框架结合了 11 项内部有效性、结构有效性和外部有效性测试,借鉴了 20 种人力资源并比较了 9 种语言模型。它将每个研究用途与其所需的证据联系起来,并测试结果如何随着我们提供的有关受访者的信息而变化。重要的是,在一个领域的出色表现并不能在其他领域建立忠诚度。模型通常回答过于一致,压缩响应尺度,并改变特征之间的关系,而更丰富的配置文件可以改善某些模型的预测,而使其他模型的预测恶化。由此产生的记分卡可帮助研究人员确定合成群体的哪些方面可以支持他们的分析以及研究人员在哪些方面需要进一步的人类证据。