未经验证的审计:当 LLM 问责层传递而不是检查时
Audit Without Verification: When LLM Accountability Layers Relay Rather Than Check
摘要
多代理 LLM 管道越来越多地跨越组织边界;当断层出现时,必须有人确定它进入的位置。可用的工件很少是完整的执行跟踪:它是每个代理提交的报告,并且提交的报告可以在其观察结果的同时陈述结论。使用预先注册的、按制度划分的六个代理管道,并具有流程级信息边界、平衡缺陷注入和匹配的干净双胞胎(每个链模型 345,600 个请求,两个模型),我们首先报告说,我们预先注册的假设(集体责任框架会随着链长度而降低升级)不受支持。然而,该层不对称地失效。它几乎没有任何来源:在 7,996 个干净的事件中零指控,每个特工都保持沉默。它对上游错误的过滤效果很差,在代理发出误报的干净事件中,分别有 34.4% 和 62.6% 的事件是无辜的。在没有代理人提出真实来源的情况下(一个链模型上的事件的 59.5%),阅读报告的审计员在 4.1% 的情况下恢复了它 - 低于统一猜测 (20%) 和最佳固定链接指控者 (31.0%) - 而从相同事件的原始文档中达到 60.3%。删除一项条款,即携带代理人自己结论的字段,可以在不断观察中隔离出原因:准确性上升至 45.2%(+41.2 pp,95% CI +35.3 至 +46.9),而依从性从 94.4% 下降至 3.4%;如果建议正确,则相同的删除反而会降低准确性,从 70.5% 到 55.7%。在四种情况中的四种(+8.5 至+39.0 pp)以及第二个域(+47.7 和+61.1 pp)中,损害会在两名前沿审计员身上复制,其中成本消失。净效应由上游可靠性以及两个条件量值决定。问责层需要足够独立于其验证的结论的证据。