论文

问责视界:治理人-智能体集体的一个不可能性定理

The Accountability Horizon: An Impossibility Theorem for Governing Human-Agent Collectives

智能体系统Agent 动作执行与治理

摘要

现有的AI系统问责框架——法律的、伦理的与监管的——都建立在一个共同假设之上:对于任何重大后果,至少存在一个可识别的人,其参与和预见足以承担实质性责任。本文证明,一旦自主性超过一个可计算的阈值,智能体AI系统对该假设的违背便不再是工程限制,而是数学必然。我们提出人-智能体集体(Human-Agent Collectives),一种对人机联合系统的形式化,其中智能体被建模为共享结构因果模型中的状态-策略元组。自主性通过四维信息论画像(认知、执行、评估、社会)来刻画;集体行为则通过交互图与联合动作空间来刻画。我们通过四个最小性质将正当问责公理化:可归因性(Attributability,责任要求因果贡献)、可预见性界(Foreseeability Bound,责任不能超出预测能力)、非空性(Non-Vacuity,至少一个主体承担非平凡责任)与完备性(Completeness,所有责任必须被完整分配)。我们的核心结果——问责不完备性定理(Accountability Incompleteness Theorem)——证明:对于任何复合自主性超过问责视界(Accountability Horizon)且交互图中包含人-智能体反馈回路的集体,任何框架都无法同时满足这四个性质。这种不可能性是结构性的:若不降低自主性,透明度、审计与监督都无法化解它。在阈值之下,正当框架是存在的,由此确立了一个鲜明的相变。在3,000个合成集体上的实验以零违例证实了全部预测。这是AI治理领域的第一个不可能性结果,确立了一条形式化边界:边界之下现有范式仍然有效,边界之上则需要分布式问责机制。

问责视界:治理人-智能体集体的一个不可能性定理:论文配图
图 1:人类代理集体拓扑。左:前馈拓扑(人工智能输出由人类审核,无反馈)始终是可控制的,无论自治级别如何。右图:反馈循环拓扑(AI 观察并适应人类反应)仅当复合自主性保持在责任地平线 Λ^*\hat{\Lambda}^{*} 以下时才可治理。