论文
AUDITA:自主多智能体系统中不良后果的认证审计与因果归因
AUDITA: certified auditing and causal attribution of adverse outcomes in autonomous multi-agent systems
摘要
物理自动化正朝着由AI大脑指挥的具身机器集群扩展。早期部署已经在以超过任何人工产线的生产速率运行工厂和仓库,其采用正在加速。但当它们的联合决策造成伤害时,所有相关方——机器供应商、算法提供方、工厂运营方、保险公司和监管机构——都有理由互相指责,而没有任何方法能在它们之间划分责任。现有方法读取来源无法验证的日志并指认单一罪魁,错误表征那些过度决定、被抢先或由不作为导致的结果。我们提出AUDITA,一个审计层,它将防篡改的智能体间命令记录与经认证的分级因果归因引擎配对。我们证明其裁决无法被操纵:守规则的智能体绝不会被冤枉为有责,试图推卸责任的行为本身会被捕获并评级,并且我们确立了基于证据的审计者所能认证的确切极限。在真实语言模型管线上,它将标准裁判基线的责任误差大致降低至三分之一;在基于事故结构的基准上,它能在单一罪魁基线失败之处恢复责任,并在伪造下保持不变。AUDITA把“谁该负责”的问题从关于日志的争论转变为基于证据的计算。