论文

HANSARD:面向自主多智能体AI系统的取证就绪、运行时见证与分级归因参考架构

HANSARD: A Reference Architecture for Forensic Readiness, Runtime Witnessing, and Graded Attribution in Autonomous Multi-Agent AI Systems

智能体系统Agent 动作执行与治理Agent Harness

摘要

自主多智能体系统如今已在金融、软件供应链与安全运营中行动,首批主要由AI编排的入侵活动也已有报道。然而,当这样的系统造成损害时,尚无方法能稳健地确定发生了什么、成因是什么、谁应负责。这是因为溯源取证工作在错误的抽象层级上,形式因果学预先假定因果模型,而智能体审计则信任自我记录。因此,目标失效模式是归因漂洗(attribution laundering),即把一个行为分散到冗余的智能体之上,直到没有任何一个是“要因”(but-for cause)。更糟的是,记录由嫌疑人自己产生——这构成了贯穿本工作始终采纳的假设:智能体因此可能预判调查,而部分日志基础设施本身也可能共谋。本文提出HANSARD,一个把问责当作全生命周期属性的参考架构。第一,在运行前封存的取证就绪档案(readiness profile)界定了事后结论所能主张的范围。第二,在智能体触达不到的五个咽喉点进行捕获,使遗漏(而不仅是篡改)可被检测。第三,一个与PROV-DM对齐的类型化因果图随系统运行而累积,三个指标实时读取它以门控监督而不做裁决。第四,事后重放依据改进的Halpern-Pearl定义给出条件性效应,并给出补偿集大小。最后,一个协同残差度量源于组合而非个体的损害,使漂洗可见。随后,原因、责任与问责被分别报告,各受证据等级上限约束,并同时给出未来研究议程。