论文
黑盒LLM分类中的评分粒度差距:置信度构建的比较研究
The Score Granularity Gap in Black-Box LLM Classification: A Comparative Study of Confidence Constructions
摘要
大语言模型 (LLM) 越来越多地被部署为管道中的黑盒分类器,可自动执行可靠的决策并将不确定的决策路由给人工审核。这种选择性预测需要操作员可以在选定的风险水平上设定阈值的置信度分数。先前的工作询问 LLM 置信度是否经过良好校准或良好排名;我们提出一个补充性的、面向部署的问题,但这个问题在很大程度上被忽视了:分数的阈值可以达到什么分辨率?我们将答案称为分数粒度差距。通过对 25 个模型数据集对(9 个 LLM,3 个基准)建立置信度得分的七种方法进行受控比较,从单个语言化数字到标记概率,到多次查询模型并组合答案,我们发现单次语言化置信度一旦正确转换为类别概率,就会对案例进行令人惊讶的良好排名,但只需要少数不同的值。因此,无论排名有多好,它都只为运营商提供几个粗略的阈值。我们展示了哪些结构扩大了这种差距,推理成本如何,以及对排名有何影响,特别是多查询聚合有助于弱模型,但可能会降低已经很强大的模型的性能。我们将这些权衡转化为具体的部署指南。