论文
综合用户,真实差异:多轮对话中用户模拟的评估框架
Synthetic Users, Real Differences: an Evaluation Framework for User Simulation in Multi-Turn Conversations
摘要
人们越来越有兴趣探索用户模拟作为收集和评分真实用户聊天机器人交互以进行人工智能聊天机器人评估的替代方案。为此,确保模拟的真实性非常重要,即模拟对话反映用户与聊天机器人的真实对话的程度。大多数现有的评估模拟真实性的方法都会产生粗糙的质量信号,并且仅停留在个体对话的水平上。为了支持该领域更严格的评估,我们提出了realsim,这是一个评估框架,使从业者能够沿着8个维度对真实对话与模拟对话进行分布观察,涵盖与交互的沟通功能、用户状态和用户消息的表面形式相关的属性。然后,我们使用 1K 多轮以任务为中心的真实用户聊天机器人对话的精选数据集实例化该框架,涵盖聊天机器人应用程序的 16 个领域。总体而言,我们发现模拟用户往往难以捕捉真实用户在交互中引入的沟通摩擦,这可能会使基于此类模拟的评估过于乐观。我们还观察到不同领域的性能差异,这可能表明需要特定领域的用户模拟器。