论文
如何判断是否大海捞针:多标签文本分类中的测量校准
How to Estimate Whether You Have Found Several Needles in a Haystack: Measuring Calibration in Multi-Label Text Classification
摘要
决定是否信任自动预测的关键因素是其置信度得分,应对其进行校准以匹配预测正确的实际概率。大多数置信度校准指标都针对二元或多类任务,而多标签校准在很大程度上仍未得到充分探索。多标签分类任务,例如为临床记录分配医疗代码或确定新闻主题,通常由大量负数(即不适用的标签)主导。我们表明,计算标签预期校准误差的现有分箱方案要么低估了误差,要么简单地反映标签频率,要么遭受许多实例很少的分箱。为了实现值得信赖的标签校准误差,我们提出了一种新的分箱方案,为正负标签分配赋予相同的权重。我们的实证研究表明,与现有的分箱方案相比,我们的新方案可以对分层和极端多标签分类中的校准误差进行有意义的估计。我们还表明,校准用于多标签预测的大型语言模型的置信度分数是一个公开的挑战。我们的详细分析为多标签分类中的测量校准提供了可靠的评估指标,为进一步研究奠定了基础。