论文
超越借用的历史:用于交互式角色扮演评估的人性化用户模拟
Beyond Borrowed Histories: Person-Aligned User Simulation for Interactive Role-Playing Evaluation
摘要
角色扮演代理(RPA)已成为大语言模型最重要的消费者应用之一。用户与 RPA 进行多轮对话以获得情绪舒适等体验,这使得可靠的评估对于衡量能力、比较系统和指导进一步改进至关重要。然而,现有的基准通常要求 RPA 继续固定的对话历史记录,然后使用与用户分离的固定规则来评估延续情况。我们确定并凭经验证明了这种设计的两个局限性。首先,RPA 的输出是由之前的对话历史决定的,从而无法对其在真实多回合环境中的角色扮演能力进行科学评估。其次,用户体验因人而异,传统的固定标准不需要与用户满意度保持一致。因此,我们引入了 PALATE(Person-Aligned LLM-Simulated-User Assessment with Tailored Evaluation),这是一个基于用户模拟器构建的可扩展 RPA 基准。 PALATE 附有 300 个角色资料库。其主要评估训练了五个每用户模拟器,让他们通过预先冻结的角色配置面板与候选 RPA 进行自由形式的多轮对话。除了通用质量评价标准外,我们还构建个性化评价标准来衡量用户满意度;在保留的注释数据上,个性化的评分标准比一般的评分标准更符合人类的判断。在对 16 个候选者的主要评估中,PALATE 分别表征了每个候选者共同构建的多转弯轨迹上的通用转弯质量、长视野会话能力和每用户体验。因此,它可以对特定的用户-RPA 对进行可解释的评估,而不是将系统压缩为独立于用户的单个排名。