99% 成功悖论:当近乎完美的检索等于随机选择时
The 99% Success Paradox: When Near-Perfect Retrieval Equals Random Selection
摘要
在信息检索 (IR) 的大部分历史中,搜索结果都是为人类消费者设计的,他们可以自行扫描、过滤和丢弃不相关的信息。这塑造了检索系统,以优化查找和排名更相关的文档,但不能保持结果干净和最小化,因为人类是最终的过滤器。然而,LLM 改变了这一点,因为它缺乏这种过滤能力。为了解决这个问题,我们引入了 Bits-over-Random (BoR),这是一种检索选择性的机会校正度量,可以揭示高成功率何时掩盖了随机级别的性能。我们将选择性测量为 $BoR = \log_{2}\left(\frac{\mathrm{P}_{obs}}{\mathrm{P}_{rand}}\right)$,其中 $\mathrm{P}_{rand}$ 是所选成功规则的超几何基线(这里,覆盖率:$ \geq1 $ 与 top-$K$ 相关)。在 20 个新闻组数据集上,BM25 和 SPLADE 均报告在 $K=100$(覆盖范围)处取得了 $>99$% 的成功,但 $BoR \approx 0$,表明该深度的随机级别选择性。当预期覆盖率 $\left(\frac{K \cdot \bar{R}_{q}}{N}\right)$ 超过 3-5 时,基线占主导地位,选择性崩溃。下游检索增强生成 (RAG) 评估证实了这一模式:LLM 准确性在 $K=100$ 时会大幅下降,这与接近于零的 BoR 上限一致。相比之下,BoR 在 BEIR/SciFact 和 MS MARCO 上仍然保持积极态度(其中 41 个系统聚集在理论上限的 0.2 位范围内,尽管存在 13 点的召回差距),确认了稀疏和大规模设置中的基线预测。我们进一步表明,崩溃边界适用于 LLM 代理工具选择,其中较小的目录大小会导致即使使用完美的选择器,选择性也会消失。这些发现表明,当额外的检索提供的选择性增益可以忽略不计,同时计算成本增加时,应将 BoR 与传统指标一起报告,并重新考虑深度选择。