论文
PersonaArena:用于评估与增强大语言模型人设级角色扮演的动态仿真
PersonaArena: Dynamic Simulation for Evaluating and Enhancing Persona-Level Role-Playing in Large Language Models
摘要
大语言模型(LLM)日益充当交互式社交代理,但其维持连贯且真实的人设级角色扮演的能力仍然有限,在真实社交场景中尤其如此。现有研究主要聚焦角色级设定并依赖静态评估形式,无法刻画日常社交互动的复杂性。在本工作中,我们提出PersonaArena,一个用于评估和改进LLM人设级角色扮演的动态仿真框架。PersonaArena利用大规模、经筛选的用户生成社交内容语料构建细致的人设库,并在仿真社交环境中引出多轮、上下文丰富的互动。我们的框架配备多代理辩论式评审,以实现整体且无偏的评估。通过大量实验,我们证明PersonaArena能对LLM角色扮演能力进行严格评估与增强,推动更真实、更具社交能力的AI代理的发展。
