论文

OfficeQA Pro:面向端到端有据推理的企业级基准

OfficeQA Pro: An Enterprise Benchmark for End-to-End Grounded Reasoning

智能体系统Agent任务评测

摘要

我们提出OfficeQA Pro,一个在庞大且异构的文档语料上评测AI智能体有据多文档推理能力的基准。该语料由跨越近100年的美国财政部公报(U.S. Treasury Bulletins)组成,包含89,000页与超过2600万个数值。OfficeQA Pro包含133个问题,需要在非结构化文本与表格数据上进行精确的文档解析、检索与分析推理。包括Claude Opus 4.6、GPT-5.4与Gemini 3.1 Pro Preview在内的前沿LLM,仅凭参数化知识在OfficeQA Pro上的准确率不足5%,辅以网络访问后也不足12%。即便直接提供文档语料,前沿智能体仍在过半问题上表现挣扎,平均得分34.1%。我们发现,为智能体提供由Databricks的ai_parse_document生成的结构化文档表示,可在各智能体上带来平均16.1%的相对性能提升。我们还进行了额外消融实验,研究模型选择、表格表示、检索策略与测试时扩展对性能的影响。尽管有这些改进,在智能体可被视为企业级有据推理的可靠方案之前,仍有巨大的提升空间。

OfficeQA Pro:面向端到端有据推理的企业级基准:论文配图
图 2:OfficeQA Pro 语料库中的代表性页面,说明了几十年来财政部公报的格式和布局如何变化。左:1941 年 3 月的关税和按关税表计算的应税进口品,以及 1939 年至 1940 年的总计和月值(千美元)。右图:1980 年 3 月财政部按类型、期限和投资者类别发行情况对有息有价公共债务证券所有权的调查(百万美元)。