论文

EnterpriseRAG:非理想企业检索下LLM指令遵循与鲁棒性基准

EnterpriseRAG: Benchmarking LLM Instruction Adherence and Robustness under Non-Ideal Enterprise Retrieval

模型评测基准与评测资源

摘要

企业检索增强生成(RAG)部署面临一个关键的可靠性缺口:虽然LLM能满足80%的单条约束,但只有26.8%的回复同时满足全部要求,暴露出57分的编排缺口。现有基准假设检索干净、查询简单,无法捕捉噪声文档与多维约束并存的生产条件。我们提出EnterpriseRAG,一个包含983个经专家验证样本、横跨六个领域的基准,系统性地模拟既有工作缺失的三种失效模式:检索噪声、知识缺口与事实冲突,并耦合复杂指令。对13个最先进LLM的评估揭示严重的指令遵循崩塌:单约束的高满足率掩盖了整体合规的低水平。关键发现暴露了知识缺口与事实冲突下的深层障碍,即使采用推理增强的推理也是如此,表明生产级RAG需要显式的上下文感知协议与经过校准的判断。EnterpriseRAG为测量和缩小这些缺口提供了可复现的基础,直接为企业级RAG系统的部署决策提供依据。我们将在论文发表时发布该基准与评估框架。

EnterpriseRAG:非理想企业检索下LLM指令遵循与鲁棒性基准:论文配图
图1:EnterpriseRAG 概览。上半部分展示复杂指令模式设计的流水线,下半部分分别展示非理想上下文模拟与评估指标。所有内容均由 LLM 自动生成并经人工质量核验。