论文
论计算机使用智能体的可靠性
On the Reliability of Computer Use Agents
摘要
计算机使用智能体(computer-use agents)在网页导航、桌面自动化、软件交互等真实世界任务上迅速进步,某些情况下已超越人类表现。然而,即使任务与模型都保持不变,一个成功执行过一次任务的智能体在重复执行同一任务时仍可能失败。这引出一个根本问题:如果一个智能体能完成某个任务一次,是什么阻碍它可靠地完成?在本工作中,我们通过三个因素研究计算机使用智能体不可靠性的来源:执行过程中的随机性、任务规约中的歧义,以及智能体行为的变化性。我们在 OSWorld 上通过重复执行同一任务并结合能够捕捉不同设置间任务级变化的成对统计检验来分析这些因素。我们的分析表明,可靠性既取决于任务如何被规约,也取决于智能体行为在多次执行之间如何变化。这些发现提示:需要在重复执行条件下评估智能体,允许智能体通过交互消解任务歧义,并优先采用跨运行保持稳定的策略。
