论文
注意差距:前沿LLM能通过标准化办公熟练度考试吗?
Mind the Gap: Can Frontier LLMs Pass a Standardized Office Proficiency Exam?
摘要
用于计算机自动化的大型语言模型 (LLM) 代理的部署正在加速,但它们导航复杂的专业级生产力软件的能力在很大程度上未经测试。我们认为,办公自动化是对文档自动化能力进行基准测试的理想环境,因为它需要长期规划和推理、精确的参数配置以及多应用程序集成。为了量化这种能力,我们引入了基于中国国家计算机等级考试(NCRE)的评估,其中包含 200 项跨 Word、Excel 和 PowerPoint 的综合实践操作任务。每项任务均使用 7,118 个机器可评分标准按照 100 分的评分标准进行评分,得分率 (SR) 表示这些任务中获得的评分标准分数的平均百分比。我们对 7 个前沿大语言模型进行了基准测试,并观察到了明显的局限性:单轮模型得分最高为 36.6%。具有执行反馈、迭代修复和更广泛的办公自动化访问权限的更强大的代理系统达到 68.8%,但仍低于用作评分健全性检查的 95.5% 社区参考分数。最终,我们的实验表明,尽管代码生成方面最近取得了进展,但实现可靠的细粒度 Office 文档自动化仍然是当前代码生成 LLM 和代理系统的重大挑战。
