论文

SaaS-Bench:计算机使用智能体能否利用真实SaaS解决专业工作流?

SaaS-Bench: Can Computer-Use Agents Leverage Real-World SaaS to Solve Professional Workflows?

智能体系统Agent任务评测长程任务评测

摘要

计算机使用智能体(CUA)正迅速将大语言模型(LLM)的能力从文本推理扩展到在更复杂环境(如网页浏览器与图形用户界面(GUI))中执行操作。然而,现有的网页与GUI智能体基准往往依赖简化设置、孤立任务或短程交互,难以评估智能体在真实专业工作流中的能力。软件即服务(SaaS)环境是CUA评估的自然选择,因为它承载了现代数字工作的很大一部分,天然涉及动态系统状态、跨应用协调、领域特定知识与长程依赖。为此,我们提出SaaS-Bench,一个构建于六大专业领域23个可部署SaaS系统之上的基准,包含106个扎根于真实工作场景的任务。这些任务需要长程执行,同时覆盖纯文本与多模态设置,并通过加权验证检查点进行评估,衡量严格任务完成度与部分进展。实验显示,代表性的LLM智能体在SaaS-Bench上表现挣扎,即使最强的模型端到端完成的任务也不足4%,暴露出规划、状态跟踪、跨应用上下文维护与错误恢复方面的局限。代码发布于 https://github.com/UniPat-AI/SaaS-Bench 以便复现。

SaaS-Bench:计算机使用智能体能否利用真实SaaS解决专业工作流?:论文配图
图 1:SaaS-Bench 排行榜。 We report overall checkpoint scores (bar length) and resolved scores for seven frontier models across 106 long-horizon SaaS tasks.