论文

LLM数字孪生何时可以减少人工测量?从行为保真度到统计可替代性

When Can LLM Digital Twins Reduce Human Measurement? From Behavioral Fidelity to Statistical Substitutability

模型评测评测方法与指标

摘要

基于大语言模型的数字孪生有望通过生成特定于个人的响应来减少重复的人类数据收集,但现有的评估几乎没有提供证据表明它们是否可以在保留有效推理的同时减少人类测量。为了解决这个问题,我们引入了统计可替代性,这是一种推断标准,用于评估双胞胎预测可以在多大程度上减少对特定估计值的人类测量,同时保留有效的推断。我们开发了一个基于混合主题和预测驱动的推理的框架,该框架从四个维度评估统计可替代性:聚合保真度、配对受访者水平信号、有限样本人类标签恢复以及人群之间的稳定性。通过涵盖行为实验、多个模型和替代受访者表征的两项实证评估,我们发现数字双胞胎可以重现平均人类效应,但几乎无法提供有关哪些个体与平均水平不同的信息。更新的模型和更丰富的受访者信息提高了某些方面的绩效,但不能可靠地转化为人力数据节省。人工校准可以减少总体预测误差,但有限的标记样本通常无法产生稳定的精度增益。重要的是,这些发现表明行为保真度对于统计可替代性既不是必要的也不是充分的。更广泛地说,他们建议对人工智能生成的证据进行评估,应根据其支持有效科学推理的能力,而不是仅根据其重现人类结果的能力。因此,应该根据数字孪生是否减少了人类数量的不确定性来判断其验证性用途,而不仅仅是根据它们是否复制了人类的手段、分布或效应。