论文

用于审计LLM社会模拟器的理由中介行为模型

Reason-Mediated Behavioral Models for Auditing LLM Social Simulators

模型评测评测方法与指标

摘要

大语言模型越来越多地被用作社会模拟器,包括充当合成调查受访者。大多数评估只问模拟结果是否与人类结果相似。我们认为这必要但太弱:模拟器可以在使用错误的、由理由导出的理由模式的同时匹配最终答案。我们通过一项94人的防晒霜概念测试研究这一问题,其中每位受访者评估三个产品概念并撰写开放式理由。我们将这些理由映射为带符号的理由状态$Z$,其中正号支持采纳,负号阻碍采纳。这提供了一个实用的审计:在固定受访者描述$D$、品类语境$K$和概念处理$X$的条件下,人类理由所导出的理由能否帮助预测行为$Y$,以及LLM能否在看不到人类理由或结果的情况下模拟出相同的理由状态?人类理由所导出的理由显著改善了对购买意向的留出预测。LLM模拟的理由更加脆弱:它们听起来往往貌似合理,但常常只是复述概念板内容,而未能还原受访者的接受或拒绝路径。本文为社会模拟器贡献了一个评估框架。理由状态本身并不能识别自然因果效应,但它们为检验模拟器所述理由是否与人类证据一致提供了一个可解释的测试。

用于审计LLM社会模拟器的理由中介行为模型:论文配图
图 1:以理性为中介的行为模型。我们固定 D、K、XD、K、X,并测试人类或 LLM 模拟的原因 ZZ 是否支持相同的行为读数。粗体箭头显示评估的介导路径;灰色虚线箭头显示受控的直接路径。