论文
GUI对比CLI:纯屏幕与技能中介计算机使用智能体的执行瓶颈
GUI vs. CLI: Execution Bottlenecks in Screen-Only and Skill-Mediated Computer-Use Agents
摘要
计算机使用智能体可经图形界面或程序化命令接口执行软件任务——但既有评估把交互模态与任务、初始状态、验证器及允许动作的差异混在一起。我们引入匹配执行层基准:跨18应用12工作流类别的440个桌面任务——纯屏幕GUI智能体与技能中介CLI智能体收到相同目标、状态与终态验证器——仅限模态原生动作。在此受控设定下——最强GUI智能体达59.1%完全通过率——胜过最强原生技能CLI智能体的48.2%;但验证器引导的技能增强把CLI成功率提到69.3%——表明CLI缺口大部分来自技能覆盖不全而非模型能力本身。这些结果表明GUI与CLI暴露不同执行瓶颈:GUI智能体受限于长程工作流上的可靠锚定交互——CLI智能体受限于其技能接口的覆盖与可扩展性。
