论文

LLM在推荐系统解释评估中的应用

The Utility of LLMs in Recommender Systems Explanation Evaluation

模型评测模型能力评测

摘要

解释是可信推荐系统的重要部分,但面对众多解释方法,仍缺乏适合具体场景的选择指南。许多方法输出抽象内容,还需转成用户可读形式;逐一用户评估难以实施,自动指标又常只评估抽象输出或需要通常不存在的标准答案。近期研究用大模型评判解释质量,但可靠性尚未充分检验。本文研究大模型能否为特定应用选择有效解释。依据不同推荐系统及用户信息生成18种解释原型,再由14个不同规模的大模型在两种温度下评价,并与用户研究的人类评分比较。大模型呈现类似人类的评分模式,排名相关性中等,但绝对评分一致性低,且随模型规模和评价维度明显变化。研究给出四点建议:生成提示保持简洁、评价优先用较大模型、预先测试评价维度,并核验解释的事实准确性,因为人类和大模型都不能可靠识别不真实内容。