论文

排序质量相近,决策仍可能不同:衡量并降低大模型评分的顺序依赖

Equal Ranking Quality, Different Decisions: Measuring and Reducing Order Dependence in LLM Scorers

模型训练监督微调与指令调优

摘要

在段落重排、回答排序与多文档问答中,大语言模型可以同时为一条提示中的多个候选单独评分。模型通常按排序质量选择,但分数最终决定阈值保留哪些候选、阅读器给出何种回答,以及哪些正负样本进入偏好训练。同一查询与同一候选集改变排列顺序,本应不改变决策,实际却会改变分数。段落重排中,五个训练后评分模型的nDCG@10差异不超过0.010,重新排列后的保留集合重合度却只有0.66–0.84。所测试的提示阶段调整均未消除依赖,唯一改善排序质量的调整也未显著改善稳定性。顺序一致性监督微调OC-SFT惩罚同一候选在不同排列下的评分分歧,在保持排序质量的同时,于三类任务的各项决策稳定性指标上领先训练后对照模型。在12个基础模型上,它也比使用排列平均标签的蒸馏更稳定;单次OC-SFT排列的保留集合重合度高于对现成模型十次排列取平均。因此,比较评分模型还应报告阈值保留结果和最终回答,不能只看排序质量。代码:https://github.com/thomsonreuters/presentation-dependence。