论文

注意差距:前沿LLM能通过标准化办公熟练度考试吗?

Mind the Gap: Can Frontier LLMs Pass a Standardized Office Proficiency Exam?

智能体系统Agent任务评测

摘要

用于计算机自动化的大型语言模型 (LLM) 代理的部署正在加速,但它们导航复杂的专业级生产力软件的能力在很大程度上未经测试。我们认为,办公自动化是对文档自动化能力进行基准测试的理想环境,因为它需要长期规划和推理、精确的参数配置以及多应用程序集成。为了量化这种能力,我们引入了基于中国国家计算机等级考试(NCRE)的评估,其中包含 200 项跨 Word、Excel 和 PowerPoint 的综合实践操作任务。每项任务均使用 7,118 个机器可评分标准按照 100 分的评分标准进行评分,得分率 (SR) 表示这些任务中获得的评分标准分数的平均百分比。我们对 7 个前沿大语言模型进行了基准测试,并观察到了明显的局限性:单轮模型得分最高为 36.6%。具有执行反馈、迭代修复和更广泛的办公自动化访问权限的更强大的代理系统达到 68.8%,但仍低于用作评分健全性检查的 95.5% 社区参考分数。最终,我们的实验表明,尽管代码生成方面最近取得了进展,但实现可靠的细粒度 Office 文档自动化仍然是当前代码生成 LLM 和代理系统的重大挑战。

注意差距:前沿LLM能通过标准化办公熟练度考试吗?:论文配图
图 1:OfficeEval 中 Word 任务的端到端图示。原始文档(左)根据任务说明(中)转换为带有标题图像、标题样式和邮件合并标签的风格小册子(右)。 2 页文档中仅显示第 1 页;多个步骤(例如,3 列布局、水印)适用于第 2 页。该任务根据 6 个技能类别的 30 个确定性标准进行评分。说明书由中文原文翻译而来;附录中提供了 Word、Excel 和 PowerPoint 中的其他示例。