论文
知识工作的设计和报告基准
Design and Report Benchmarks for Knowledge Work
摘要
LLM 代理的发展导致了知识工作人工智能方面的工作不断增长,包括编码、研究和医疗保健。然而,当前的知识工作评估和基准设计仍然很大程度上遵循传统 NLP 任务的逻辑。因此,较高的基准性能并不能可靠地表明系统可以在实际部署设置中执行知识工作。本文提出了一种三步方法,用于明确基准任务如何表示与其分数相关的工作声明:定义评估中的工作活动、指定测试设置以及对适当的工作产品进行评分。我们回顾了工作研究,表明知识工作是通过角色和职责、本地材料和工具以及必须在下游工作流程中保持可用的工件来组织的。然后,我们将这些问题转化为基准设计和报告指南,涵盖如何将任务映射到工作活动,测试设置应如何指定材料、工具、角色和约束,以及评分应如何关注系统留下的工作产品。为了命名正在评估的工作活动并将其与常见的基准任务区分开来,我们从 O{*}NET 职业任务数据库中得出了 18 项工作活动的清单。我们通过三个基准案例分析展示了该方法:GDPval,一个非代码职业可交付基准; OfficeQA Pro,一个基于最终答案的文档分析基准; APEX-SWE,一个具有可执行评分产品的软件工程基准。这些案例展示了基准设计选择如何塑造分数可以支持的最强有力的工作主张,以及基准任务、测试设置、评分产品和更广泛的工作主张之间存在差距的地方。
