论文

哪些重新排序结论在答案界面中仍然存在?前瞻性有限轨道审计

Which Reranking Conclusions Survive the Answer Interface? A Prospective Finite-Orbit Audit

模型评测评测方法与指标

摘要

重新排序器越来越多地通过下游语言模型答案进行评估。这就提出了一个检索测量问题:如果只有读者的答案界面发生变化,我们是否应该对 BM25 与 BGE-v2-m3 得出相同的结论?我们前瞻性地与四名读者一起审核了他们对 RAGuard 和 FEVER 的声称配对效果。检索策略、证据、主张和上下文深度保持固定,而语义到标签绑定、A/B 与 X/Y 词汇以及选项顺序形成八个任务等效接口。我们询问估计的检索策略效果、其排序或选择值是否发生变化。六个确认设置中没有一个显示经统计认证的界面变化高于预先指定的 0.015 实质性阈值,也没有一个显示经认证的 BM25-BGE 排序逆转。在一种环境中,选择器分歧达到 33.5%,但八种环境中都没有建立预先指定的材料保留值差异。这些结果不支持广泛的复制不稳定性,但它们并没有证明普遍不变性:五种设置仍然太不确定,无法满足预先指定的高阶等价条件。它们说明了为什么检索评估应该将策略级别、界面稳定性、策略排序和选择值分开。当稳定性未经验证时,对具有显式变化范围的枚举接口进行统一平均可以避免赋予一个接口特权。