论文
CorporateBench:基于时序知识库的大规模问答基准
CorporateBench: Large-Scale Q&A Benchmarking with Temporal Knowledge Bases
摘要
LLM越来越能够回答关于企业级文档集合的复杂问题。但评估很难:企业不愿分享内部通讯,而合成数据集又过于简单。我们提出CorporateBench(CB),一个经人工校验的多任务问答基准,其规模接近LLM在企业通讯网络中面临的条件,评估语料库超过230,000份文档。CB通过四家从12人到10,000名员工的合成企业,从信息抽取和知识库查询两个维度评估LLM。每个语料库都从一个描述一致世界、随时间演化的知识库中采样,确保即使在数十万文档之间也具有跨文档逻辑一致性。我们在CB上评估五个LLM,发现随着输入规模接近现实尺度,性能越来越差。CB为LLM开发者提供了企业通讯推理的度量指标,填补了基准生态中的关键空白。
