论文

用于评估会话推荐系统的快速域适应和细粒度用户模拟

Towards Fast Domain Adaptation and Fine-Grained User Simulation for Evaluating Conversational Recommender Systems

模型评测评测方法与指标

摘要

会话推荐系统(CRS)通过多轮交互增强用户体验,但评估其性能仍然具有挑战性。虽然基于 大语言模型 (LLM) 的用户模拟器很有效,但它们存在三个关键限制:(1) 缺乏领域适应性:依赖固定提示和预定义的操作空间阻碍了向新领域的迁移; (2)用户建模有限:无法准确复制微妙的语言风格和动态偏好; (3)评估有效性不足:现有模拟器未能充分评估基本能力和系统鲁棒性。为了克服这些问题,我们提出了 AdaptSim,一个自适应域和自动提示调整用户模拟器。 AdaptSim 通过实现真实的行为建模和多样化的风格生成,提供了一个评估 CRS 的有效框架。它利用自动提示生成和开放操作机制来减少手动工作并提高跨域灵活性。对于响应生成,我们采用受控文本生成和“思考然后响应”策略,以对语言风格进行细粒度控制。对于 CRS 评估,AdaptSim 结合了一种新颖的基于广度优先搜索 (BFS) 的轮级成对比较框架来进行综合评估。跨三个领域和四个 LLM 的广泛实验表明,AdaptSim 可以生成真实的对话,从而能够对 CRS 功能和鲁棒性进行高效、可靠的评估。