论文

ComponentBench:诊断计算机使用智能体的组件级失败

ComponentBench: Diagnosing Component-Level Failures in Computer-Use Agents

智能体系统Agent任务评测长程任务评测

摘要

当前对计算机使用智能体的评估被分割为长时程工作流基准与原子化GUI定位测试,中间留下一个测量不足的层次:以真实组件为中心的交互(如切换一组按钮),它们足够短以便诊断,又足够丰富以捕捉现代界面的负担。我们提出ComponentBench,一个面向现代Web UI对计算机使用智能体进行组件级评估的基准与诊断管线。ComponentBench围绕一个与库无关的97种规范UI组件本体组织,实例化为2910个经程序化验证的任务,覆盖广泛使用的组件库,并配有清理过的人类参考轨迹,可同时评估任务成功与交互效率。除任务收集外,我们还引入一个可扩展的管线,用于在实现后审计实际结构难度,并跨任务和组件族合成结构化的失败分析。我们评估了七个模型——GPT-5.4、Gemini 3 Flash、GPT-5.4 mini、GPT-5 mini、Gemini 3.1 Flash-Lite、Qwen3-VL-235B和UI-TARS-1.5-7B——覆盖四种观察与动作空间,结果显示这些设计选择对性能有决定性影响。在同一个共享评估框架内,仅改变观察与动作空间就会使同一模型的任务成功率变化超过30%:GPT-5 mini在可访问性树观察下为83.1%,而在仅坐标的Pixel控制下降至48.9%。此外,即便最快的配置也比匹配的人类参考慢3.7倍,对人类而言轻而易举的空间操作仍在困扰当前智能体。

ComponentBench:诊断计算机使用智能体的组件级失败:论文配图
图1:ComponentBench在97种组织为14个族群的规范UI组件类型上评估计算机操作(computer-use)智能体。左:任务涵盖在Ant Design、MUI和Mantine中实现的多种交互类型。右:该本体覆盖了现代Web UI交互的广度。