多跳检索中的可预测失败:分数分布置信度评分和弃权
Predictable Failure in Multi-Hop Retrieval: Score-Distributional Confidence Scoring and Abstention
摘要
多跳检索失败在查询中的分布并不均匀:它们聚集在结构上可预测的子群中。我们证明了形式化该结构的两个结果。首先(CWAR 可归约性):当且仅当检索特征携带有关成功的相互信息时,才可以实现置信失败减少,这是 LLM 判断管道满足的条件,但在仅密集设置中要弱得多,这解释了制度之间的 AUC-AC 差距。第二(特征体系互补性):没有任何一个 ANN 评分特征能够在所有故障体系中实现最佳预测性能;数据集之间的主要特征有所不同(MuSiQue 上的查询长度,HoVer 上的 hop-1 集中度),并且建设性的见证对显示每个特征在一种制度中是必要的,而在另一种制度中是非贡献性的。我们在 RegimeAbstain 中实例化这些原则,它计算检索置信度分数 (RCS),这是最多九个查询 ANN 结构特征的逻辑函数,所有这些特征都无需任何额外的 LLM 调用即可使用,并使用它来实施校准的弃权政策。我们定义了置信错误答案率 (CWAR) 指标,并评估了三个多跳基准(MuSiQue、2WikiMultiHopQA、HoVer)和两种检索架构(LLM 判断和仅密集),涵盖了 CWAR 从 14.5% 到 62.1% 的五种故障情况。 RCS 在所有五种条件下针对八个置信基线实现了最佳或并列最佳 AUC-AC。在 MuSiQue(LLM 法官)上,RCS 在 50% 覆盖率下将 CWAR 从 39.5% 降低到 20.6%(相对降低 47.8%),ECE=0.035。在 MuSiQue 上训练的模型转移到 2WikiMultiHopQA 时 AUC 损失仅为 -0.5pp,证实了政权特征的与领域无关的结构。