论文
OfficeQA Pro:面向端到端有据推理的企业级基准
OfficeQA Pro: An Enterprise Benchmark for End-to-End Grounded Reasoning
摘要
我们提出OfficeQA Pro,一个在庞大且异构的文档语料上评测AI智能体有据多文档推理能力的基准。该语料由跨越近100年的美国财政部公报(U.S. Treasury Bulletins)组成,包含89,000页与超过2600万个数值。OfficeQA Pro包含133个问题,需要在非结构化文本与表格数据上进行精确的文档解析、检索与分析推理。包括Claude Opus 4.6、GPT-5.4与Gemini 3.1 Pro Preview在内的前沿LLM,仅凭参数化知识在OfficeQA Pro上的准确率不足5%,辅以网络访问后也不足12%。即便直接提供文档语料,前沿智能体仍在过半问题上表现挣扎,平均得分34.1%。我们发现,为智能体提供由Databricks的ai_parse_document生成的结构化文档表示,可在各智能体上带来平均16.1%的相对性能提升。我们还进行了额外消融实验,研究模型选择、表格表示、检索策略与测试时扩展对性能的影响。尽管有这些改进,在智能体可被视为企业级有据推理的可靠方案之前,仍有巨大的提升空间。
