论文

CorporateBench:基于时序知识库的大规模问答基准

CorporateBench: Large-Scale Q&A Benchmarking with Temporal Knowledge Bases

模型评测基准与评测资源

摘要

LLM越来越能够回答关于企业级文档集合的复杂问题。但评估很难:企业不愿分享内部通讯,而合成数据集又过于简单。我们提出CorporateBench(CB),一个经人工校验的多任务问答基准,其规模接近LLM在企业通讯网络中面临的条件,评估语料库超过230,000份文档。CB通过四家从12人到10,000名员工的合成企业,从信息抽取和知识库查询两个维度评估LLM。每个语料库都从一个描述一致世界、随时间演化的知识库中采样,确保即使在数十万文档之间也具有跨文档逻辑一致性。我们在CB上评估五个LLM,发现随着输入规模接近现实尺度,性能越来越差。CB为LLM开发者提供了企业通讯推理的度量指标,填补了基准生态中的关键空白。

CorporateBench:基于时序知识库的大规模问答基准:论文配图
图1:与九个先前基准在证据数量和问题数量上相比,CorporateBench 推进了多文档问答基准测试的技术水平。CB 达到每问题 87.6 篇文档的高比率,而最接近的基准(EKRAG)比率为 1.5(Yu et al., 2025)。高比率表明问题需要跨大量文档综合信息,更能反映真实企业知识工作的复杂性。