论文

LayerRAG-Bench:代理检索增强生成的跨层可靠性基准

LayerRAG-Bench: A Cross-Layer Reliability Benchmark for Agentic Retrieval-Augmented Generation

模型评测基准与评测资源

摘要

代理检索增强生成系统可以生成看似有根据的答案,但在证据、工具契约、授权或会话状态层上却失败了。我们推出了 LayerRAG-Bench,这是一个受控的跨层可靠性基准测试,包含 8 个企业域、240 个任务、9 个故障场景、2 种合约模式以及来自 OpenAI、Anthropic 和 Gemini 的 9 个模型的 38,880 条实时任务级记录。模式规范化将模式漂移成功率从 0.000 提高到 0.913,但模式规范化无法恢复过时的证据、丢失的工具输出、拒绝的权限和错误的会话上下文。在陈旧和错误的会话证据下,仅基于基础的评估也会产生大量误报。这些结果支持特定层的评估原则:可靠性干预应归功于修复其目标层,而不会被误认为是通用修复。