论文

GUI对比CLI:纯屏幕与技能中介计算机使用智能体的执行瓶颈

GUI vs. CLI: Execution Bottlenecks in Screen-Only and Skill-Mediated Computer-Use Agents

智能体系统Agent任务评测Agent Skills

摘要

计算机使用智能体可经图形界面或程序化命令接口执行软件任务——但既有评估把交互模态与任务、初始状态、验证器及允许动作的差异混在一起。我们引入匹配执行层基准:跨18应用12工作流类别的440个桌面任务——纯屏幕GUI智能体与技能中介CLI智能体收到相同目标、状态与终态验证器——仅限模态原生动作。在此受控设定下——最强GUI智能体达59.1%完全通过率——胜过最强原生技能CLI智能体的48.2%;但验证器引导的技能增强把CLI成功率提到69.3%——表明CLI缺口大部分来自技能覆盖不全而非模型能力本身。这些结果表明GUI与CLI暴露不同执行瓶颈:GUI智能体受限于长程工作流上的可靠锚定交互——CLI智能体受限于其技能接口的覆盖与可扩展性。

GUI对比CLI:纯屏幕与技能中介计算机使用智能体的执行瓶颈:论文配图
图 1:概述。 440 个桌面任务的匹配执行层基准测试在相同的目标、状态和验证器下对 GUI 和技能介导的 CLI 代理进行了比较。结果表明,所观察到的 CLI 差距受到技能覆盖范围的强烈影响,而 GUI 将程序执行嵌入到界面中。