论文

覆盖计算机使用的人类行为空间:数据合成和基准

Covering Human Action Space for Computer Use: Data Synthesis and Benchmark

模型评测基准与评测资源

摘要

计算机使用代理 (CUA) 可以自动化屏幕上的工作,如 GPT-5.4 和 Claude 所示。然而,它们在复杂、低频交互方面的可靠性仍然很差,限制了用户的信任。我们对高级模型失败案例的分析表明,GUI 操作中存在一种长尾模式,其中复杂多样的交互中相对较小的一部分占了任务失败的不成比例的比例。我们假设这个问题很大程度上源于复杂交互的数据稀缺。为了解决这个问题,我们提出了一个新的基准 CUActSpot,用于评估模型在跨五种模式的复杂交互上的能力:GUI、文本、表格、画布和自然图像,以及各种操作(单击、拖动、绘图等),与之前主要关注 GUI 小部件的以点击为中心的基准相比,涵盖了更广泛的交互类型。我们还设计了一个基于渲染器的数据合成管道:为每种模态自动生成场景,记录屏幕截图和元素坐标,并且 LLM 生成匹配的指令和动作轨迹。在该语料库上进行训练后,我们的 Phi-Ground-Any-4B 的性能优于参数少于 32B 的开源模型。我们将在 https://github.com/microsoft/Phi-Ground.git 发布我们的基准、数据、代码和模型