论文

注意智能体任务用户模拟中的Sim2Real差距

Mind the Sim2Real Gap in User Simulation for Agentic Tasks

模型评测模型训练强化学习评测方法与指标RLVR

摘要

随着NLP评估从静态基准转向多轮交互设定,基于LLM的模拟器被广泛用作用户代理,承担生成用户轮次与提供评估信号两种角色。然而这些模拟常被默认忠实于真人行为,缺乏严格验证。我们形式化用户模拟中的Sim2Real差距,并开展首个以真人跑完完整τ-bench协议的研究(451名参与者、165个任务),用我们提出的User-Sim Index(USI)指标在专有、开源与专用家族的31个LLM模拟器上做基准测试。行为上,LLM模拟器过度配合、风格单一、缺乏真实挫折感与歧义,制造出抬高智能体成功率至人类基线之上的「简单模式」。评估中,真人在八个质量维度给出细致判断,而模拟用户产出一致更正面的反馈;基于规则的奖励无法捕捉人类用户生成的丰富反馈信号。总体而言,更强的通用模型能力并不必然带来更忠实的用户模拟。这些发现凸显在智能体开发周期中使用LLM用户模拟器时人类验证的重要性,并推动改进用户模拟模型。

注意智能体任务用户模拟中的Sim2Real差距:论文配图
图 6:人体研究中使用的注释界面。右侧面板显示任务说明和角色扮演指南,左侧面板提供聊天界面,用于与代理交互并在交互结束后提交任务后调查。