计算机使用代理的不确定性量化:视觉语言模型和 GUI 基础数据集的基准
Uncertainty Quantification for Computer-Use Agents: A Benchmark across Vision-Language Models and GUI Grounding Datasets
摘要
计算机使用代理将视觉语言模型 (VLM) 预测转化为可执行的 GUI 点击,因此可靠的不确定性估计对于拒绝、校准、失误严重性排名和空间安全区域至关重要。然而,关于这些代理的事后不确定性量化 (UQ) 的证据在孤立的模型和数据集对中分散,因此不清楚当代理、基准或可观察接口发生变化时,UQ 排名是否保持稳定。我们推出了 Argus,这是一个用于事后 UQ 的单步可执行 GUI 基础的跨机制基准:一个超过 4 个 VLM 代理和 4 个数据集的 27 种方法开放权重矩阵,加上一个跨 3 个前沿供应商的 8 种方法闭源矩阵,其中 logits、隐藏状态和注意力图不可用。评估方法涵盖基于 logits 的分数、采样和一致性度量、隐藏状态和密度估计器(Mahalanobis、SAPLMA)、基于注意力的分数、P(True)和言语置信度提示以及分裂保形预测。主要发现是选择性转移:UQ 排名在固定模型的数据集上是稳定的,但在模型类和可观察接口上会下降。隐藏状态和密度方法是最稳定的开放权重系列,而 CoCoA-1MCA、Focus、基于采样的分数和口头自我评估在特定体系中获胜。模型内排名转移很强(Spearman rho 高达 0.969),但到闭源供应商的跨层转移平均只有 +0.08,因此闭源 UQ 应该根据目标重新排名,而不是外推。共形点击区域显示分数级别歧视对于部署来说是不够的:当校准插件 UQ 时,本地加权磁盘的半径缩小 40-60%,但覆盖范围会在校准测试或接口不匹配的情况下降低。我们在 GUI智能体 中发布了每个项目的记录、校准/测试分割、UQ 分数和用于状态感知 UQ 选择的分析脚本。