论文

AgentPersonaBench:角色驱动的用户模拟基准测试

AgentPersonaBench: Benchmarking Persona-Driven User Simulation

智能体系统Agent任务评测

摘要

我们引入了 AgentPersonaBench (APB),这是一个评估角色调节是否忠实地引导下游智能体行为的基准。虽然语言模型越来越多地用于角色驱动的用户模拟,但现有的基准主要评估对话样式或自我报告,而不是真实的行为保真度。 APB 一次评估一个特征的潜在角色依从性,将每个目标特征嵌入到完整的综合档案中,而无需明确命名该特征或披露测试。真实情况的遵守是通过四个日益真实的交互界面的可观察行为来严格验证的:调查、聊天、网络(交互式网络环境)和应用程序(桌面软件环境)。 APB 包含涵盖 867 个特征的 2,460 项任务,并通过自动审核和专家评审进行验证。我们对 20 个前沿模型臂的评估表明,高保真度用户模拟已经可以实现:领先模型在无提示条件下实现高达 84.7% 的全通遵守率。与此同时,APB 确定了明确的行为边界:交互方式的依从性下降(只有 37.9-64.3% 通过所有四个表面),多属性要求降低了保留率,竞争模型系列表现出明显的行为分歧。

AgentPersonaBench:角色驱动的用户模拟基准测试的原论文方法或结果图
图 8:所有四个表面上的跨模型差异。每个面板都使用相同的 6 个 OpenAI 手臂和 140 个匹配场景。单元格给出了列模型通过的行模型失败场景的百分比,四舍五入为整数百分比。括号给出该行的故障分母;因此,较高的百分比可能代表很少的任务。共享的色标允许跨表面进行比较。所有标签均指 GPT 模型。图 9 中单独报告了十八臂跨供应商分析。