论文
注意智能体任务用户模拟中的Sim2Real差距
Mind the Sim2Real Gap in User Simulation for Agentic Tasks
摘要
随着NLP评估从静态基准转向多轮交互设定,基于LLM的模拟器被广泛用作用户代理,承担生成用户轮次与提供评估信号两种角色。然而这些模拟常被默认忠实于真人行为,缺乏严格验证。我们形式化用户模拟中的Sim2Real差距,并开展首个以真人跑完完整τ-bench协议的研究(451名参与者、165个任务),用我们提出的User-Sim Index(USI)指标在专有、开源与专用家族的31个LLM模拟器上做基准测试。行为上,LLM模拟器过度配合、风格单一、缺乏真实挫折感与歧义,制造出抬高智能体成功率至人类基线之上的「简单模式」。评估中,真人在八个质量维度给出细致判断,而模拟用户产出一致更正面的反馈;基于规则的奖励无法捕捉人类用户生成的丰富反馈信号。总体而言,更强的通用模型能力并不必然带来更忠实的用户模拟。这些发现凸显在智能体开发周期中使用LLM用户模拟器时人类验证的重要性,并推动改进用户模拟模型。
