论文

排列不稳定性何时普遍化? Listwise LLM 重新排名的独立视图验证

When Does Permutation Instability Generalize? Independent-View Validation for Listwise LLM Reranking

模型评测评测方法与指标

摘要

列表语言模型重新排序器通常在等效候选排列中存在分歧。因此,有限不稳定性诊断用于激发额外的采样、聚合或选择性计算。但是,与重复使用探测视图的验证统计数据的关联不需要隔离有关未见排列的预测信息。共享测量可以引发经典的部分-整体关联。我们研究这如何影响有限视图不稳定性分数预测看不见的排列的说法。我们推导出精确的有限视图分解,并前瞻性地比较零个、一个和两个重用视图,包括完全不相交的四视图目标。该研究涵盖两个固定的 7B 模型系列和两个推荐数据集,其中包含用于签名离线分析的受控列表和用于无目标复制的未触及的检索器列表。在四个受控块上,完全不相交的相关性较弱或异质(-0.061 至 0.281),而重复使用两个探测视图会产生 0.600 至 0.718;所有配对的对比度都很大(0.436 到 0.661)并且具有 Holm 显着性。重叠效应在所有四个未触及列表块中都是积极的。将探针从两个视图增加到四个视图,仅在一个块中就可以明显提高不相交的可靠性。此外,探针预测聚合运动幅度(Spearman rho = 0.142 至 0.426),但不是稳定的签名目标收益,并且 12 个固定分数探针路由点中的 7 个严格以测量成本为主。因此,当预期的估计值是关于看不见的扰动行为的预测信息时,验证目标必须与探针观察分离以隔离该信息;签署的公用事业和成本敏感决策仍然是不同的问题。