论文
AgentPersonaBench:角色驱动的用户模拟基准测试
AgentPersonaBench: Benchmarking Persona-Driven User Simulation
摘要
我们引入了 AgentPersonaBench (APB),这是一个评估角色调节是否忠实地引导下游智能体行为的基准。虽然语言模型越来越多地用于角色驱动的用户模拟,但现有的基准主要评估对话样式或自我报告,而不是真实的行为保真度。 APB 一次评估一个特征的潜在角色依从性,将每个目标特征嵌入到完整的综合档案中,而无需明确命名该特征或披露测试。真实情况的遵守是通过四个日益真实的交互界面的可观察行为来严格验证的:调查、聊天、网络(交互式网络环境)和应用程序(桌面软件环境)。 APB 包含涵盖 867 个特征的 2,460 项任务,并通过自动审核和专家评审进行验证。我们对 20 个前沿模型臂的评估表明,高保真度用户模拟已经可以实现:领先模型在无提示条件下实现高达 84.7% 的全通遵守率。与此同时,APB 确定了明确的行为边界:交互方式的依从性下降(只有 37.9-64.3% 通过所有四个表面),多属性要求降低了保留率,竞争模型系列表现出明显的行为分歧。
