论文

通过 大语言模型 和嵌套数据的应用来估计分类器性能的不确定性

Estimating Uncertainty in Classifier Performance with Applications to Large Language Models and Nested Data

模型评测评测方法与指标

摘要

研究人员越来越多地使用文本分类(监督模型或 大语言模型)来测量自然语言的结构,提供召回率和精确度等指标作为其有效性的证据。然而,尽管这些指标是受抽样变化影响的点估计,但不确定性的衡量指标与它们一起报告的情况并不一致。此外,当报告它们时,当相关标记数据集很小或性能很高时,通常会使用不合适的方法来估计它们。为了增加和改进该领域的置信区间报告,本文评估了社会科学文本分类的典型条件下性能指标的置信区间方法:小到中等样本量、不常见的结构以及嵌套在个体中的文本。在整个模拟过程中,Wald 区间和基本百分位数引导等默认方法的准确度最低,覆盖范围有时远低于标称 95% 的水平。通过使用 Agresti-Coull、Wilson、Clopper-Pearson 和新颖的伪计数正则化引导程序(与 F1 的计算特别相关),可以提高准确性。当文本嵌套在个体中时,我们证明调整有效 N 和适当的自由度对于产生准确的分析区间是必要的。在引导区间中,当个体产生中等数量的文本时,分层引导比集群引导更准确,但当个体只产生少量文本时,分层引导则过于保守。通过为该领域提供适当的区间估计指导,我们的目标是提高机器学习应用的透明度,并鼓励在设计阶段更多地关注验证样本大小。