论文
LLM 重新排名者可以预测自己的排名表现吗?
Can LLM Rerankers Predict Their Own Ranking Performance?
摘要
不同查询的检索效果差异很大,因此在相关性判断可用之前估计排名质量非常重要。查询性能预测(QPP)解决了这一需求,但大多数现有方法在检索或重新排名后依赖于外部预测器。在本文中,我们研究 \textit{reranker-internal QPP}:LLM 重排序器能否估计其刚刚产生的排名的质量?我们研究了 无需训练 和基于训练的方法。对于 无需训练 估计,我们检查了采样排名中特定指标的自我一致性以及重新排名器直接生成的语言置信度。使用四个 LLM 在 TREC 深度学习 2019--2022 上进行的实验表明,自我一致性与最先进的 (SOTA) 方法相比具有竞争力,并且在几乎所有设置中都得到了更好的校准,而直接口头表达的信心则严重过度自信。为了提高言语置信度,我们提出了两种监督方法,Verb-Num 和 Verb-List,这使得 LLM 重新排名器只需几个额外的输出标记即可生成校准的排名质量估计。