论文

用大语言模型作为人类响应数据的低成本统计估计器

Using Large Language Models as Low-Cost Statistical Estimators for Human-Response Data

应用与实践科学研究

摘要

社会科学和行为科学领域的定量研究依赖于昂贵、缓慢且易受抽样偏差影响的人体实验。在这里,我们表明,预训练的大型语言模型在平方损失下引入了条件期望的风险等价估计,建立了受限功能风险等价:在平方损失下,LLM 引入了一个估计器,其风险与仅通过条件均值依赖于数据的任何推理的条件期望的平方损失预测的贝叶斯最佳风险相匹配。我们将 LLM 形式化为在 i.i.d.\ 数据上训练的错误指定的函数估计器 $T(\hat{P}_n)$,​​将估计误差分解为表征偏差 $ε_{\mathrm{rep}}$ 和优化误差,并证明在温和的规律性条件下,LLM 的预期误差收敛于不可约总体方差加上平方表征偏差,表征偏差受 Pinsker 不等式限制。可识别性误差 $δ$ 传播到有效偏差中,从而扩大了渐近风险下限。我们通过双向 Le Cam 缺陷分析建立了受限功能风险等价:前向缺陷渐近消失,而反向缺陷恰好为零。我们提供有限样本浓度范围和具有明确决策规则的校准协议。结果是一个精确的、可证明的陈述:经过良好校准的大语言模型在明确的范围条件下实现了条件均值依赖推理的贝叶斯最优风险。在实际应用中,这意味着在满足条件和校准良好的模型的情况下,大型语言模型可以用于许多原本依赖人体实验的预测和决策任务,以较低的成本逼近近乎最优的统计推断。