论文

CUE:多轮基准的校准用户嵌入模拟器

CUEing User Simulators: Calibrated User Embeddings for Multi-Turn Benchmarking

智能体系统Agent任务评测

摘要

近期基准依赖用户模拟器在多轮交互中评估AI智能体。现有仿真技术对人类风格与行为具有表面保真度,但生态有效的交互基准还要求:模拟用户与真实用户群在同一智能体上何时及如何失败的分布对齐。我们发现现有模拟器缺乏结果校准——与真实用户同一智能体下观察到的成功率及失败模式的一致性。我们提出校准用户嵌入(CUE):既编码观察到的会话又采样连续表示,再解码为引导LLM扮演用户模拟器的角色命令,无需训练。借此我们评估过去会话的用户条件回放,以及为相同任务采样新角色时的聚合指标一致性。在τ²-Bench上,CUE化模拟器比其他基于角色的模拟方法更少出现模拟器归因错误,并更忠实地再现真实用户的智能体失败模式、聚合成功率与特定任务-用户对的结果。这些增益与既有工作指标度量的有竞争力用户保真度共存。在以客服交互为主的数据上拟合后,同一CUE化模拟器泛化到文档创建、数学辅导与闲聊,并在不同模拟器LLM间保持有效而无需重训。