论文

EnterpriseRAG-Bench:公司内部知识的 RAG 基准

EnterpriseRAG-Bench: A RAG Benchmark for Company Internal Knowledge

模型评测基准与评测资源

摘要

检索增强生成 (RAG) 已成为将 大语言模型 纳入训练期间无法获得的信息的标准方法。虽然现有的数据集和基准侧重于网络或其他公共来源,但仍然没有广泛采用的数据集能够真实反映公司内部知识的性质。与此同时,初创公司、企业和研究人员正在越来越多地开发旨在对此类专有数据进行操作的人工智能代理。为了缩小这一差距,我们发布了一个综合企业语料库、其生成框架和排行榜。我们展示了 EnterpriseRAG-Bench,这是一个数据集,包含涵盖 9 种企业源类型(Slack、Gmail、Linear、Google Drive、HubSpot、Fireflies、GitHub、Jira 和 Confluence)的约 500,000 个文档以及涵盖 10 个类别的 500 个问题,用于测试不同的检索和推理能力。该语料库的生成具有跨文档一致性(基于共享项目、人员和计划),并通过诸如错误归档文档、近似重复和冲突信息等现实噪音进行增强。问题集范围从简单的单文档查找到多文档推理、约束检索、冲突解决以及信息缺失时的识别。生成框架允许团队生成适合自己行业、规模和源组合的变体。数据集、代码、评估工具和排行榜可在 https://github.com/onyx-dot-app/EnterpriseRAG-Bench 上获取。