论文

测量和缩小真实用户行为和模拟用户行为之间的分布差距

Measuring and Mitigating the Distributional Gap Between Real and Simulated User Behaviors

模型评测评测方法与指标

摘要

随着用户模拟器越来越多地用于人工智能助手的交互式训练和评估,它们代表真实用户的不同行为至关重要。虽然现有的工作训练用户模拟器生成类似人类的响应,但它们是否捕获真实用户行为的广泛且异构的分布仍然是一个悬而未决的问题。在这项工作中,我们引入了一种方法来测量真实用户行为和模拟用户行为之间的分布差距,并通过人体研究和消融进行验证。给定真实和模拟对话的数据集,我们的方法从每个对话中提取用户行为的表示,通过聚类将它们量化为离散分布,然后计算分歧指标。我们对 24 个基于 LLM 的用户模拟器在编码和写作任务方面进行了首次系统评估,并揭示了与真实用户之间存在的巨大分布差距,这种差距因模型系列、规模和行为方面而异。成对比较表明,大多数模拟器的行为相似,但也有少数模拟器表现不同。与单独的模拟器相比,结合行为互补的模拟器可以使最终的分布更接近真实用户。最后,对簇的 TF-IDF 分析揭示了模拟器捕获、错过和产生幻觉的可解释的行为模式。