论文

LLM-as-a-Judge,在 Top-K 推荐中进行可靠且可解释的离线评估

LLM-as-a-Judge for Reliable and Explainable Offline Evaluation in Top-K Recommendation

模型评测评测方法与指标

摘要

推荐评估对于指导推荐系统的细化和部署起着至关重要的作用。大多数现有试验依赖于离线评估,使用根据坚持用户行为计算的 Top-K 指标。然而,我们发现两个基本限制削弱了他们提供可靠和可解释的评估的能力。关于可靠性,离线评估将观察到的用户反馈视为真实偏好的代理,并强制代理和推荐之间进行严格的 ID 匹配。在实践中,反馈收集本质上是由不完整和有偏见的项目暴露决定的,导致评估失真和不可靠。关于可解释性,Top-K 指标仅建立数字分数,而没有提供有意义的见解来支持它们,从而强化了离线评估的黑盒性质。在本文中,我们提出了一种可靠且可解释的 LLM-as-a-Judge 框架,用于离线推荐评估。为了提高可靠性,我们引入了用户文本行为的语义代理来表示他们的真实偏好。该代理允许在语义空间中的偏好和推荐之间进行更灵活的匹配,而不是依赖于坚持反馈。为了确保可解释性,LLM Judge 采用推理然后评分的流程来生成相关性判断以及明确的理由。最后,我们将各个分数汇总为全局 Top-K 指标,以量化整体推荐质量,并为每个偏好的成功或失败提供理由。大量实验表明,LLM Judge 在评估方面具有可靠的可靠性、可解释性和鲁棒性。