论文

LatentAudit:面向检索增强生成的实时白盒忠实性监控与可验证部署

LatentAudit: Real-Time White-Box Faithfulness Monitoring for Retrieval-Augmented Generation with Verifiable Deployment

模型评测评测方法与指标

摘要

检索增强生成(RAG)能缓解幻觉但无法消除幻觉:已部署的系统仍需在推理时判断其答案是否真正得到检索证据的支持。我们提出LatentAudit,一个白盒审计器,它汇聚开放权重生成器的中后段残差流激活,并度量其与证据表示之间的马氏距离。由此得到的二次型规则无需辅助评判模型,在生成时运行,且足够简单,可在小型保留集上校准。我们证明残差流几何承载了可用的忠实性信号,该信号在架构变更和真实检索失败下依然存在,且同一规则仍可支持公开验证。在PubMedQA与Llama-3-8B上,LatentAudit达到0.942 AUROC,开销仅0.77ms。在三个问答基准和五个模型家族(Llama-2/3、Qwen-2.5/3、Mistral)上,该监控器保持稳定;在包含矛盾、检索缺失和部分支持噪声的四路压力测试下,它在PubMedQA上达到0.9566-0.9815 AUROC,在HotpotQA上达到0.9142-0.9315。在16位定点精度下,该审计规则保留了FP16 AUROC的99.8%,使得基于Groth16的公开验证成为可能,且不泄露模型权重或激活。综合来看,这些结果将残差流几何定位为实时RAG忠实性监控以及可选可验证部署的实用基础。

LatentAudit:面向检索增强生成的实时白盒忠实性监控与可验证部署:论文配图
图 1:LatentAudit 管道概述。输入:问题和检索到的证据被输入到开放权重LLM。监控:L14L_{14}–L16L_{16}层的答案状态激活和证据表示通过马哈拉诺比斯距离DMD_{M}进行比较; 0.77 毫秒内得到的分数将这一代分类为忠实或有风险。可验证部署(可选):分数被量化并封装在 Groth16 零知识证明中,用于链上验证,而无需透露模型权重或激活。