论文
个性化轮次用户对话满意度基准
Personalized Turn-Level User Conversation Satisfaction Benchmark
摘要
用户对人工智能助手的满意度是高度个性化的:同样的响应可能会让一个用户满意,但另一个用户会失望,这取决于每个用户的期望和他们之前的要求。现有的自动评估方法大多测量通用的响应质量,很难判断特定回合的响应是否令用户满意。我们研究这个问题作为个性化回合级用户对话满意度评估。我们构建了一个对话满意度评估器,将紧凑的用户记忆与目标转向上下文相结合,以产生满意度分数和以不满意为导向的理由。针对人类满意度注释的元评估表明,与监督的、基于检索的和通用的 LLM-as-a-judge 基线相比,个性化记忆和事后评分校准可改善序数一致性和不满意回合检测。我们进一步介绍了 PersTurnBench,这是一种个性化的回合级用户对话满意度基准,它使用经过验证的评估器通过重播来评估生成模型。通过固定重放状态,PersTurnBench 可以对通用生成模型和记忆增强个性化系统进行受控比较,而无需为每个候选模型添加新的人工标签。评估器和基准使研究人员可以比较候选生成模型的个性化满意度,而无需收集每个模型的新用户反馈。