论文
处于统计悬崖边缘的计算机使用
Computer Use at the Edge of the Statistical Precipice
摘要
在交互式环境中评估计算机使用代理(CUA)充满了该领域尚未系统解决的方法论陷阱。我们证明,在不观察屏幕的情况下盲目执行记录的动作序列的 1MB 重放脚本在著名的静态基准测试中优于前沿模型,并证明其预期成功率与确定性环境中源代理的 pass@k 完全相等。我们将这一失败和其他失败追溯到两个根本原因:无原则的环境设计(静态、非沙盒或不可靠的验证环境)和无原则的评估方法(幼稚的聚合和误用 pass@k 进行有状态 UI 交互)。为了解决第一个问题,我们提出了 PRISM,即 CUA 环境的五项设计原则(特权验证、现实环境、完整性检查配置、沙盒执行和多因素可变性),并在 DigiWorld 中实例化它们,DigiWorld 是 15 个真实沙盒移动应用程序的基准,能够在超过 320 万个经过验证的独特配置中评估代理。为了解决第二个问题,我们开发了一个聚合框架,将 Wilson 评分区间与分层自助法配对,生成正确解释 CUA 基准嵌套结构的置信区间,正如我们凭经验证明的那样。总之,我们表明原则性的环境设计和严格的评估方法不是可选的改进,而是有意义的 CUA 研究的先决条件。