论文
可靠的 LLM 判断的保证金自适应置信度排名
Margin-Adaptive Confidence Ranking for Reliable LLM Judgement
摘要
荣格等人。 (2025) 引入了一个假设检验框架,用于保证 大语言模型 (LLM) 和人类判断之间的一致性,依赖于模型的估计置信度相对于人类不一致风险是单调的假设。然而,在实践中,这个假设可能会被违反,并且置信估计器的泛化行为没有被明确分析。我们通过学习专用的置信估计器而不是依赖启发式置信信号来缓解这些问题。我们的方法利用模拟注释器多样性和基于边际的排名公式来明确建模 LLM 区分人类一致和人类不一致情况的信心程度。我们进一步推导了该估计器的泛化保证,揭示了依赖于边际的权衡,为自适应估计器训练程序的设计提供了信息。当集成到固定序列测试中时,学习的置信度估计器可以提高排名准确性,并根据经验加强置信度和分歧风险之间的单调关系,从而提高跨多个数据集和判断模型满足目标一致性水平的成功率。