论文
使用角色向量研究 LLM 用户模拟器中的助理偏差
Investigating Assistant Bias in LLM User Simulators Using a Role Vector
摘要
基于 LLM 的用户模拟器越来越多地用于大规模评估自主代理,以代替昂贵的人工评估。尽管有这样的承诺,这些模拟器还是表现出了“协助偏见”,即合作和追求任务目标的倾向。他们很少重现真实用户表现出的挫败感或脱离感,从而损害了评估的有效性。之前的工作概述了这种偏见是在 模型训练 期间产生的,而角色扮演提示无法覆盖这一点。我们从模型激活中分析这种偏差,通过对比模型如何表示用户与助理对同一对话的观点来提取用户角色向量。我们观察到两个发现:(i)用户方向在激活中是可识别的,引发类似用户的行为,并捕获与助理特征不同的特征; (ii) 尽管用户角色激活与模拟真实性相关,并且引导强化了它,但它可能会夸大用户行为并覆盖个人用户配置文件。总之,我们的研究结果提供了 LLM 用户模拟器的表征级分析,证实助理偏见在结构上是可识别的,并且可以定向分析用户行为。