论文

PPT-Eval:计算机使用代理执行 PowerPoint 任务的基准

PPT-Eval: A Benchmark for Computer-Use Agents on PowerPoint Tasks

智能体系统Agent任务评测

摘要

创建和编辑幻灯片是一种丰富的多模式活动,在专业和教育环境中无处不在,使其成为现实世界中计算机使用代理的理想测试平台。 Microsoft PowerPoint 是应用最广泛且功能丰富的演示文稿创建环境之一。我们引入了 PPT-Eval,这是跨 12 个文件的 120 个 PowerPoint 任务的基准,涵盖内容创建和演示文稿编辑场景,并按难度进行组织。该领域的一个核心挑战是评估:任务是复杂的、多模式的,并且通常需要许多有效的解决方案。此外,当今的代理经常只取得部分进展,而二元成功指标无法捕捉到这一点。为了解决这个问题,我们设计了一个强大的评估框架,以帮助为 PowerPoint 任务创建特定于任务的评分标准,从过去基于评分标准的评估工作中汲取灵感并以此为基础。这些准则对中间步骤给予部分奖励,惩罚不必要的更改和不良美观,并提供自然语言反馈。这种细致入微的方法被证明非常有效,与人类判断的 Kendall τ-b 相关性达到 0.77。我们发现现有的前沿代理仍然难以解决 PowerPoint 任务,像 Claude-4.5-Opus 这样的强大模型仅实现 45% 的成功率,平均部分得分为 57%。该基准测试位于:https://microsoft.github.io/ppteval。