论文
LLM-as-a-Judge,用于评估会话音乐推荐中的系统响应
LLM-as-a-Judge for Evaluating System Responses in Conversational Music Recommendation
摘要
会话推荐系统(CRS)旨在实现两个主要目标:推荐相关项目和生成自然语言响应。虽然推荐的准确性可以通过既定的排名指标来有效衡量,但响应生成的评估提出了更根本的挑战。尽管人类评估仍然是金标准,但其成本和可扩展性限制促使人们采用 LLM 作为法官作为有前途的代理,其与 CRS 背景下人类判断的一致性仍然是一个悬而未决的问题。在本文中,我们提出了第一个用户研究,以实证评估 LLM 作为法官评估 CRS 响应的可靠性。我们对 20 个多轮音乐推荐会话进行采样,并使用四个指令调整的 LLM 生成候选系统响应,从而在模型尺度上引入响应质量的差异。我们从 20 位领域专家注释者那里收集了 $n{=}400$ 评分,他们从两个维度评估每个回复:个性化质量和解释质量。通过引导相关分析,我们发现基于 LLM 的法官与人类评估表现出适度的正向一致性,并且优于所有基于参考的基线。此外,我们分析了裁判性能如何根据模型规模和调节信息而变化,为部署 LLM-as-a-judge 提供实用指导。