论文

随机语义证据图:代理人工智能的不确定性传播和治理

Stochastic Semantic Evidence Graphs: Uncertainty Propagation and Governance for Agentic AI

模型评测评测方法与指标

摘要

人工智能代理评估通常会检查最终答案,但错误可能会通过证据、检索、提示、生成或决策映射进入。我们引入了随机语义证据图(SSEG),这是一种分层随机 DAG,其语言节点扩展为自回归标记子图,其可观察输出可能是完整短语的法则。语义缩减和校准是可选的。我们定义与图相关的局部缺陷和下游边缘影响,得出终端错误的路径界限,并使用其节点项来诊断治理触发器。对于来源出处,该图保留了不确定的声明-段落关系,并传播了尖锐的弗雷谢界限,而不是假设来源之间的独立性。在三种开放权重架构中,信息等效的变化实质上改变了完整短语定律。一项对照实验在 5,000 个案例中未发现任何证书违规行为;交叉 RAG 和实时 Brave 检索实验将检索、呈现、来源和交互效果分开。因此,SSEG 将工作流程来源转变为对不确定性从何处进入、如何传播以及输出是否合格使用的定量说明。