论文

CUA-Suite:针对计算机使用代理的大量人工注释视频演示

CUA-Suite: Massive Human-annotated Video Demonstrations for Computer-Use Agents

模型评测基准与评测资源

摘要

计算机使用代理 (CUA) 在自动化复杂桌面工作流程方面前景广阔,但由于缺乏连续的高质量人类演示视频,通用代理的进展受到了瓶颈。最近的工作强调,连续视频,而不是稀疏的屏幕截图,是扩展这些代理的关键缺失要素。然而,现有最大的开放数据集 ScaleCUA 仅包含 200 万张屏幕截图,相当于不到 20 小时的视频。为了解决这一瓶颈,我们推出了 CUA-Suite,这是一个为专业桌面计算机使用代理提供专家视频演示和密集注释的大型生态系统。其核心是VideoCUA,它在87个不同的应用程序中提供了大约10,000个人工演示的任务,具有连续的30 fps屏幕记录、运动学光标轨迹和多层推理注释,总计大约55小时和600万帧的专家视频。与仅捕获最终点击坐标的稀疏数据集不同,这些连续视频流保留了人类交互的完整时间动态,形成了可以无损转换为现有代理框架所需的格式的信息超集。 CUA-Suite 还提供了两个互补资源:UI-Vision(用于评估 CUA 中的界面元素定位和规划能力的严格基准)和 GroundCUA(一个包含 56K 带注释的屏幕截图和超过 360 万个 UI 元素注释的大规模界面元素定位数据集)。初步评估表明,当前的基础行动模型与专业桌面应用程序存在很大差距(约 60% 的任务失败率)。除了评估之外,CUA-Suite 丰富的多模态语料库还支持新兴的研究方向,包括通用屏幕解析、连续空间控制、基于视频的奖励建模和视觉世界模型。所有数据和模型均公开发布。