论文

回归风格:在用户模拟中创作和测量角色保真度的社会语言学方法

Back in Style: A Sociolinguistic Approach to Authoring and Measuring Persona Fidelity in User Simulation

模型评测智能体系统Agent任务评测评测方法与指标

摘要

随着 agentic 系统获得商业普及,用户模拟器越来越多地充当其评估的测量工具。然而,与真实人类用户相比,模拟用户的保真度通常较低,并且通常由昂贵的主观LLM法官进行评估。在这项试点研究中,我们询问是否可以通过从社会语言学角度对待用户角色来确定性地测量保真度:作为一种从可观察的语言风格中产生的社会类型,而不是通过模型必须推断为行为的标签或描述来预测的社会类型。我们将角色创作为具体的文体率,这让我们可以将两种已建立的、无模型的工具——作者验证文体测量法和基于词典的内容分析——作为保真度诊断。我们针对五个面向任务的客户服务代理的扁平描述基线对社会语言学模式进行了 A/B 测试。结果表明,社会语言学模式提高了大多数测试模型的风格依从性和风格区分度,但需要注意的是,角色风格 忠诚度并不一定等于人物角色的“自然性”。我们认为,角色设计的社会语言学方法是实现更多样化和更具代表性的用户角色的一条有希望的道路,并且这些指标在错误归因分析中最有价值,可以定位保真度下降的地方。这是干预措施的第一步,使用户模拟更接近多样化和可变语言输出的忠实呈现。