论文

OmegaUse-OfficeVal:基于经济锚定的长程办公套件任务LLM智能体基准评测

OmegaUse-OfficeVal: Benchmarking LLM Agents on Long-Horizon Office-Suite Tasks with Economic Grounding

智能体系统Agent任务评测长程任务评测

摘要

人们日益期待大语言模型(LLM)智能体协助用户完成任务。然而,现有基准在评估智能体能否以合理成本执行办公套件工作流方面支持有限。我们提出OmegaUse-OfficeVal,一个以任务级经济锚定来评估LLM智能体长程办公套件任务的基准。该基准包含100个任务,源自从业者提出的办公套件请求,并经隐私保护流程改编。平均而言,这些任务需要2.32小时的人工劳动才能完成。该基准的一个重要特点是,每个任务都配有两个经济信号:人工劳动时间和任务价格代理。这些信号使人工成本与LLM推理成本的直接比较以及价值加权评估成为可能。为支持稳定的评估,我们基于细粒度评分细则开发了代码式验证器。我们评估了多个前沿LLM,并设置人类基线作对照。尽管所有受测LLM都比人类工作者便宜且快速得多,但它们尚未接近人类水平的交付质量。代码与数据集已完全开源,更多信息见我们的项目网站:https://omegause-officeval.github.io。

OmegaUse-OfficeVal:基于经济锚定的长程办公套件任务LLM智能体基准评测:论文配图
图 5:OmegaUse-OfficeVal 的任务构建管道。