论文
相同的结果,不同的旅程:用于比较生产搜索系统中人类和 GUI智能体 行为的跟踪级框架
Same Outcomes, Different Journeys: A Trace-Level Framework for Comparing Human and GUI-Agent Behavior in Production Search Systems
摘要
LLM 驱动的 GUI智能体 越来越多地用于生产系统中,以实现工作流程自动化并模拟用户进行评估和优化。然而,大多数 GUI智能体 评估都强调任务成功,并为智能体是否以类人方式交互提供有限的证据。我们提出了一个跟踪级评估框架,该框架比较人类和代理的行为(i)任务结果和工作量,(ii)查询制定,以及(iii)跨界面状态的导航。我们在生产音频流搜索应用程序的受控研究中实例化了该框架,其中 39 名参与者和最先进的 GUI智能体 执行十个多跳搜索任务。代理取得了与参与者相当的任务成功率,并生成了广泛一致的查询,但遵循系统上不同的导航策略:参与者表现出以内容为中心的探索行为,而代理则更加以搜索为中心和低分支。这些结果表明,结果和查询对齐并不意味着行为对齐,从而在将 GUI智能体 部署为生产搜索系统中的用户代理时激发跟踪级诊断。