论文
事实缺失的地方:气隙 LLMAgent 管道中信息遗漏的分层分类和每层归因
Where Facts Go Missing: A Layerwise Taxonomy and Per-Layer Attribution of Information Omission in Air-Gapped LLMAgent Pipelines
摘要
气隙和本地语言模型代理可以在源摄取和最终答案生成之间的任何边界上默默地忽略决策关键事实。我们提出了一个九层分类法(L0-L8)、一个仪器化归因工具和一个条件遗漏瀑布,用于区分确定性软件丢失和行为不可检索。我们分析了 75,476 项受控综合试验,涵盖五种开放权重模型配置和两个推理引擎,以及一个单独的 372 项试验真实代理试点,涵盖 FHIR、PubMed 和 SEC-EDGAR 源,并通过 LangChain 和 ADK 编排。加权综合基准的遗漏率为 0.574(95% CI:0.571-0.578);在 L0-L3 处故意注入的确定性故障占基准分配下加权损失的 73.4%。增加上下文长度与遗漏关系最为密切(比值比 7.43,95% CI:5.44-10.15)。已完成的服务器配置文件分析将 q4 KV 缓存和扩展的 RoPE 与更高的遗漏相关联。在真实代理试点中,总体而言,57.8% 的跟踪不成功,排除执行错误后,50.9% 的跟踪仍然不成功。这些结果在受控压力测试中建立了管道级归因,但基准分配、混杂模型比较和启发式行为标签无法衡量生产普遍性或因果架构效应。