论文

原样:将 LLM 搜索评估与历史用户偏好保持一致

As It Was: Aligning LLM Search Evaluation with Historical User Preferences

模型评测评测方法与指标

摘要

大规模搜索系统的发展速度超过了人类质量保证的规模,特别是对于长尾意图和多语言查询。 LLM-as-a-judge 方法为评估搜索引擎结果页面 (SERP) 的相关性提供了一种可扩展的替代方案,但仅基于语义相似性或世界知识的判断可能会偏离实际用户偏好,特别是对于模糊查询。我们引入了一种基于行为的 LLM 判断,该判断以查询—相关性—曝光 (QRI) 卡的形式通过轻量级且可审核的行为先验来增强每个 SERP 项目。每张卡片都总结了用户历史上如何与类似的查询和结果进行交互,提供了法官可以引用的紧凑的经验证据来解决歧义并做出更一致的相关性判断,同时仍然依赖语义推理。在 Spotify 的大规模音乐搜索评估中,使用从 6,000 个重组 SERP 的历史用户交互中得出的相关性估计,基于行为的判断与用户偏好实现了更强的一致性,总体上将 Spearman 排名相关性提高了约 5%,并且在分歧情况下相对改善了 91%。在跨越五种语言的多语言人类判断数据集上,历史行为依据进一步将与人类相关性判断的相关性提高了 15%。重要的是,当根据实时 A/B 测试的结果进行评估时,以历史行为为依据的评审器始终表现出与观察到的获胜模型更高的一致性。虽然绝对对齐仍然中等,但这些发现表明,轻量级行为依据可以提高现实世界搜索系统中基于 LLM 的评估的可靠性和实用性。