论文
UserProxyBench:评估 LLM 用户模拟器的代理基准和培训
UserProxyBench: Evaluating LLM User Simulators for Agent Benchmarks and Training
摘要
交互式代理基准测试和多轮强化学习越来越多地将第二语言模型置于用户角色中。该模拟用户控制Agent接收哪些信息以及何时接收信息,但当前的基准测试仅对Agent进行评分,而不直接衡量用户是否正确执行了分配的角色。我们引入了 UserProxyBench(tau-bench 系列的评估层)和用户保真度评分(UFS),该评分使用基于任务的评分标准来衡量对基准的私人用户指令的遵守情况,而评分标准与Agent的成功无关。将Agent固定在 GPT-5.5 并在 375 个企业任务更改中仅改变用户Agent意味着任务奖励增加 15.2 个点,而 24.4% 的成功事件包含用户规范违规。主要的失败是过早披露:用户在请求之前提供信息。这种行为对任务奖励影响不大,但在成功的事件中,它会导致Agent平均减少 1.06 次工具调用,从而在保留奖励的同时改变了正在评估的交互。最后,通过七个Agent,我们确定了一个经验成本保真度边界,使从业者能够选择满足所需保真度水平的最便宜的模拟器。