论文

用多校准LLM实现无偏流行率估计

Unbiased Prevalence Estimation with Multicalibrated LLMs

模型评测鲁棒性、公平性与可信度评测

摘要

使用不完美的测量设备(诊断测试、分类器或大语言模型)估计某一类别在总体中的流行率,对科学、公共卫生以及线上信任与安全而言都至关重要。标准方法会对已知的设备错误率进行校正,但假设这些错误率在各总体之间保持稳定。我们证明该假设在协变量偏移下会失效,而多校准(multicalibration)——即要求模型不仅平均意义上校准,还要在输入特征条件下校准——足以在此类偏移下实现无偏的流行率估计。标准校准与量化方法无法提供这一保证。我们的工作将近期关于公平性的理论工作与一个横跨几乎所有学科的长期测量问题联系起来。仿真实验证实,标准方法的偏差随偏移幅度增长,而多校准估计器保持近乎为零的偏差。尽管我们的讨论主要聚焦于LLM,理论结果适用于任何分类模型。两个实证应用——利用American Community Survey估计美国各州的就业流行率,以及用LLM对四个国家的政治文本进行分类——表明多校准在实践中能大幅降低偏差,同时提示校准数据应覆盖目标总体可能存在差异的关键特征维度。