论文
模型版本升级对LLM相关性评判的影响
The Impact of Backbone Evolution on LLM-Based Relevance Assessments
摘要
LLM正在迅速发展,新的模式提供了更强大的能力。这表明,在基于LLM的相关性判断中,能力更强的模型将在相同的提示下与人类的判断取得更高的一致性。我们通过调查基于 LLM 的相关性裁判在骨干进化下的行为来挑战这种理解。保持提示固定,我们在商业(Gemini、GPT)和开放权重(Qwen、Llama)模型的顺序模型版本中评估代表性的单提示(UMBRELA)和基于标题的提示(EXAM)。总的来说,我们没有发现一致的证据表明新版本可以带来更好的相关性判断。至关重要的是,相似或改进的总体表现并不意味着判断稳定性:早期版本的 LLM 主干做出的正确判断不一定会被后续版本保留。我们研究了这些回归的潜在驱动因素。我们的研究结果警告不要假设为一个骨干版本设计和验证的判断提示在模型更新时将表现相同或更好,即使是在 同一个家庭。
