为什么 GUI智能体 正确但晚了?对决策时间关键路径进行解码,并使用预编译的策略树进行测试
Why Are GUI Agents Correct but Late? Decode on the Decision-Time Critical Path, Tested with Pre-Compiled Policy Trees
摘要
计算机使用代理通常会在处理瞬态 GUI 事件时失败,因为它们仅在相关窗口关闭后才产生正确的操作。我们认为主要原因是决策时间关键路径上昂贵的自回归解码。我们提出了自适应预期策略树(AAPT),它可以在不修改底层模型的情况下消除这种延迟。在空闲屏幕期间,相同的冻结多模式模型构建了一个有界条件策略树,其中包含可观察的防护、预授权的操作和特定于分支的截止日期。该树的大小可以覆盖模型自身的解码延迟。当事件发生时,轻量级观察者将更改门控帧与准备好的分支相匹配,并立即执行相应的操作,而不生成新的文本。在使用预先注册的端点和精确 McNemar 测试的配对试验中,AAPT 在有争议的决策窗口 ($p=1.8\times10^{-3}$) 内将成功率从 0.50 提高到 0.79,同时不会产生任何错误操作。开环基线和预测和重新计划基线都实现零成功,因为它们在执行期间仍然进行解码。准备时间扫描表明,增益出现在基于延迟的树大小规则预测的地方,而消融揭示了三个关键要求:快速观察者解码、有效的树规划和准确的分支路由。预先注册的预言机探针拒绝了我们最初的假设,而是指出分支路由是因果瓶颈。我们进一步在 126 个配对试验中重现了对独立通用多模态模型的影响 ($p=4.9\times10^{-13}$)。在外部基准测试中,AAPT 与反应基线的整体性能相匹配,尽管这两种方法表现出互补的优势。总之,这些结果表明,当可以提前枚举候选操作时,AAPT 表现最佳,而当不能提前枚举候选操作时,反应式执行仍然更强。