论文

重新思考基于LLM的社会模拟的评估与优化

Rethinking the Evaluation and Optimization of LLM-Based Social Simulation

模型评测基准与评测资源

摘要

基于LLM的社会模拟是对传统方法(如调查与行为实验)的有前景补充。核心问题是如何评估LLM模拟人类行为的保真度,并据此优化LLM。主流做法用准确率评估——检查模型是否选中从某个人身上观察到的唯一响应——并训练LLM复现这一硬标签。然而,人类行为本质上是主观的:同一个人在相同情境下也可能合理地采取不同行动,因此观察到的响应只是底层响应分布的一次抽样,这使基于准确率的评估不可靠,硬标签训练也有误导性。为解决这些问题,我们首先引入主观性系数——一个基于熵的量,用以区分编码等客观任务与社会模拟等主观任务——并用它系统分析随主观性增长,基于准确率的评估和硬标签训练如何失效。基于主观性系数,我们提出主观性自适应软标签训练(SALT):它把语义邻近输入的观察输出汇集成软分布标签,聚合半径随每个输入估计的主观性自适应调整;在接近客观的极限下邻域收缩,因此SALT自然退化为标准单标签训练。此外,由于现有数据集只记录单次观察响应、无法支持分布化评估,我们构建了SUBJSIM,一个包含19,300个情境、覆盖193名标注者和100个主观问题的基准。由于真实世界数据通常每个输入只提供单次观察,我们的实验从单次观察输出训练模型,而对照完整响应分布进行评估,验证了现实设定下的可行性。SUBJSIM上的结果证明了我们方法的优势。

重新思考基于LLM的社会模拟的评估与优化:论文配图
图14:标注界面截图。该平台以中文部署,供以中文为母语的标注者使用;此处展示的界面是用于演示的英文翻译版本。