论文
评估与缓解基于LLM的社会科学测量中的误校准
Assessing and Mitigating Miscalibration in LLM-Based Social Science Measurement
摘要
大语言模型(LLM)在社会科学中越来越多地被用作可扩展的测量工具,将非结构化文本转换为可进入标准实证设计的变量。测量效度不仅要求高平均准确率,还要求校准良好的置信度,能如实反映每次测量正确的经验概率。本文研究基于LLM的社会科学测量中的模型误校准问题。我们从FOMC的案例研究开始,表明当LLM置信度误校准时,基于置信度的过滤会改变下游回归估计。随后我们审计了14个社会科学构念上的校准情况,涵盖GPT-5-mini、DeepSeek-V3.2等专有模型以及开源模型。跨任务和模型家族,报告的置信度与基于容差的正确性对齐很差。作为一种简单的缓解手段,我们提出用LLM校准BERT的软标签蒸馏流水线。该方法将LLM评分及其言语化置信度转换为软目标分布,然后在编码器模型上针对这些目标训练较小的判别式分类器。跨数据集平均,该方法将ECE降低43.2%,将Brier分数降低34.0%。这些结果表明,基于LLM的社会科学流水线应把校准视为测量效度的一部分,而不是可选的后处理事项。