论文
Agent评测中可控用户模拟的三层画像向量
A Three-Tier Persona Vector for Controllable User Simulation in Agentic Evaluation
摘要
评估工具增强的 LLM 智能体需要多样化、现实的用户输入,但大多数评估框架使用简单的角色描述(“你是一位愤怒的客户”),无论底层场景如何,都会产生几乎相同的对话。在本文中,我们提出了一个具有 23 个可操作维度的三层角色向量:6 个分类人口统计数据(管辖权、年龄、渠道、设备、语言熟练程度、时间可用性)、12 个连续行为特征(耐心、自信、数字素养等),使用围绕策划的配置文件基本向量的高斯噪声进行采样,以及 5 个根据场景上下文而变化的连续情绪状态(沮丧、焦虑、信任、信心、压力)。与角色正交,一个 4 级查询复杂性覆盖层控制着从直接到刻意模糊的措辞措辞。我们在跨越 8 个命名配置文件和 3 个生产语料库的 64,698 个多轮对话中评估合成数据生成管道内的角色模型。主要发现:(i) 不同角色的智能体目标实现率相差 15.8 个百分点,这证实了特质向量会产生明显不同的用户行为; (ii) 由于场景反应性情绪状态的变化,同一角色在不同场景中的行为有所不同,从而验证了场景反应性设计; (iii) 特定领域的项目显示角色对预订流程合规性的敏感性(层级感知角色和压力测试角色之间的差距约为 15-20 个百分点),证明该模型忠实地再现了现实世界的难度分布; (iv) 七个规则描述的特征相关性产生可审计的共现模式,而不需要学习协方差矩阵。角色模型完全指定用于复制。