论文

推理失败之前:Agentic RAG未阅读证据的流程失效

Before Reasoning Fails: Pre-Evidence Procedural Failures in Agentic RAG

智能体系统Agent 动作执行与治理

摘要

代理检索增强生成(RAG)系统在证据条件推理之前失败:代理可能检索候选片段但不检查它们。我们研究这种失败模式作为代理轨迹中的过程属性,通过保存工具调用记录、检索证据、阅读段落和最终答案将错误答案分解为预证据条件失败和后金标准读取失败。在HotpotQA、2WikiMultiHopQA和MuSiQue上的12,000对轨迹中,这两种失败类型在正则表达式和spaCy实体提取器上几乎不冗余:两者触发率在[11.2%,13.1%]之间。然后我们评估Read-Gate,一个最小运行不变量,要求代理在搜索后阅读并在最终化前阅读。强制阅读在那些原本跳过阅读的轨迹上提高了LLM-Acc 14.9-19.9个百分点,在全最小推理单元中提高了3.2-9.4个百分点。额外诊断显示,更大的隐藏思考预算并不一定意味着更多的证据检查。这些结果表明,证据收集应该作为轨迹级别控制问题单独评估,而不是答案侧推理。

推理失败之前:Agentic RAG未阅读证据的流程失效:论文配图
图3 :座席制度中的错误指标。学科失败在gpt-5-mini极小值时达到峰值;金牌后读取误差遵循不同的曲线。X轴是区域级,而不是缩放曲线。