论文

论计算机使用智能体的可靠性

On the Reliability of Computer Use Agents

智能体系统Agent任务评测长程任务评测

摘要

计算机使用智能体(computer-use agents)在网页导航、桌面自动化、软件交互等真实世界任务上迅速进步,某些情况下已超越人类表现。然而,即使任务与模型都保持不变,一个成功执行过一次任务的智能体在重复执行同一任务时仍可能失败。这引出一个根本问题:如果一个智能体能完成某个任务一次,是什么阻碍它可靠地完成?在本工作中,我们通过三个因素研究计算机使用智能体不可靠性的来源:执行过程中的随机性、任务规约中的歧义,以及智能体行为的变化性。我们在 OSWorld 上通过重复执行同一任务并结合能够捕捉不同设置间任务级变化的成对统计检验来分析这些因素。我们的分析表明,可靠性既取决于任务如何被规约,也取决于智能体行为在多次执行之间如何变化。这些发现提示:需要在重复执行条件下评估智能体,允许智能体通过交互消解任务歧义,并优先采用跨运行保持稳定的策略。

论计算机使用智能体的可靠性:论文配图
图 1:(左)强大的计算机使用代理(带有 GPT-5 的代理 S3)在重复尝试中的性能。虽然 Pass@10 达到大约 78%,但相应的 Pass^10 表明代理在所有 10 次执行中仅成功完成了大约 36% 的任务,这表明在重复执行中实现可靠性具有挑战性。 (右)导致不可靠性的因素概述。我们将任务执行分解为三个部分:执行期间的随机性、任务规范的模糊性以及代理行为的可变性,这会对重复执行的可靠性产生不利影响。