论文

CUAAudit:视觉语言模型作为计算机使用智能体审计者的元评估

CUAAudit: Meta-Evaluation of Vision-Language Models as Auditors of Autonomous Computer-Use Agents

模型评测评测方法与指标

摘要

计算机使用智能体(CUA)正在成为人机交互的新范式,通过感知高层自然语言指令在桌面环境中自主执行任务。随着此类智能体能力渐强并被部署到多样桌面环境,以可扩展且可靠的方式评估其行为成为关键挑战。现有评估管线依赖静态基准、基于规则的成功判定或人工检查,脆弱、昂贵且与真实使用脱节。本文研究以视觉语言模型(VLM)作为自主审计者,直接从可观测交互评估CUA任务完成度,并对五个VLM开展大规模元评估:给定自然语言指令与最终环境状态判断任务是否成功。评估横跨macOS、Windows与Linux上的三个广泛使用的CUA基准,沿准确率、置信度校准与模型间一致性三个互补维度分析审计者行为。我们发现,尽管最先进的VLM有较强的准确率与校准,所有审计者在更复杂或异构环境中均表现明显退化,且高性能模型之间的判断分歧显著。这些结果暴露了当前基于模型的审计方法的根本局限,凸显在真实环境部署自主CUA时必须显式考虑评估者的可靠性、不确定性与方差。

CUAAudit:视觉语言模型作为计算机使用智能体审计者的元评估:论文配图
图1:VLM审计器在macOSWorld、Windows Agent Arena和OSWorld上的准确率,按均值升序排列。