论文
HybridCUA:学习为计算机使用Agent编排 GUI 和 CLI
HybridCUA: Learning to Orchestrate GUI and CLI for Computer-Use Agents
摘要
计算机使用Agent(CUA)在完成数字任务方面表现出了强大的能力。然而,现有的 CUA 要么仅仅依赖于图形用户界面 (GUI) 交互,这通常效率低下且容易出错,要么通过应用程序特定的 API 或工具来增强 GUI 交互,这需要大量的工程工作并且难以跨应用程序扩展。我们认为下一代 CUA 应该将 GUI 交互与命令行界面 (CLI) 结合起来,利用 GUI 的通用性和 shell 命令的效率。然而,一个关键的挑战是当前模型不知道在任务执行期间何时或如何使用 CLI。为了应对这一挑战,我们开发了一个数据构建管道,可生成三种类型的轨迹:仅 GUI、仅 CLI 以及交错的 GUI 和 CLI 轨迹。该管道产生了 HybridCUA-8K,其中包含 5K 混合轨迹和 3K 验证的 RLVR 任务。基于这些数据,我们提出了一个包含两个阶段的训练框架:对构建的轨迹进行监督微调,然后使用我们的 CLI 感知奖励进行强化学习,鼓励Agent有选择且可靠地使用 CLI。实验表明,HybridCUA-9B在OSWorld上的准确率达到了53.6%,比基础模型提高了14.8个百分点,在WindowsAgentArena上的性能提高了4.0个百分点。这些结果证明了计算机使用Agent的混合 GUI 和 CLI 范例的有效性和跨平台通用性。