论文

EviRank:基于 LLM 的排名的基于证据的置信度估计

EviRank: Evidence-Based Confidence Estimation for LLM-Based Ranking

模型推理推理验证与自校正

摘要

大语言模型 显示了推荐的希望,但由于有限的域覆盖范围和固有的随机性,它们引起了可靠性问题。现有的不确定性量化方法存在两个基本挑战:(1)为问答设计的全局置信度得分无法揭示排名列表中哪些位置不可靠; (2) 从模型内部提取的细粒度置信度在所有位置上都表现出一致的低值,从而无法过滤不可靠的预测。为了应对这些挑战,我们提出了基于 LLM 的排名的基于证据的置信度估计 (EviRank)。我们从一次前向传递中提取三个补充证据,并通过可靠的意见聚合来聚合它们。此外,我们认识到排名位置本质上是不平等的,并引入了位置感知校准。最后,校准后的置信度指导排名优化。对三个数据集的实验表明,我们的方法在推荐和不确定性量化方面均实现了最先进的性能。