论文
校准仪器:LLM 驱动的合成群体的可控性
Calibrating the Instrument: Controllability of an LLM-Driven Synthetic Population
摘要
生成合成种群(GSP)——种群合成、基于代理的建模和 LLM 代理的融合——正在吸引人们对城市模拟和机构传播研究日益增长的兴趣。在任何普惠制工具用于真实人群之前,必须回答一个更基本的问题:它是否以有序、可复制、群体结构的方式对已知价态的刺激做出反应?我们称之为可控性。我们问的不是合成群体是否追踪人类,而是它是否追踪自身:我们强加给它的潜在结构是否在它自己的反应中恢复。从逻辑上讲,这个内部有效性问题先于任何关于外部有效性的主张,就像表征仪器的响应函数必须先于使用它来检验理论一样。我们报告了 SIVE(合成仪器验证实验):一个虚构的城市(蒙特拉戈),拥有 120 个已知潜在结构的合成角色,暴露于关于水网络的强积极到强消极机构沟通的七种条件下。七个预先注册的标准,通过温度扫描进行评估,共同评估保真度、稳定性、本底噪声、特异性、灵敏度和排序。所有七个都在每个温度下通过。一个核心发现将校准失败转变为诊断成功:设计为“弱阳性”的消息被仪器识别为功能阴性,可追溯到其文本中未解决的问题、不确定性和制度被动性;重新设计的版本恢复了预期的顺序,并以意想不到的方式与代理的潜在信任进行交互。噪声子实验表明,仪器的固有噪声大约是跨代理估计值的一半,并且在不同温度下保持稳定。个体的轨迹揭示了汇总统计数据所掩盖的连贯的微观动力学。完整数据可通过交互式浏览器获得。