问责视界:治理人-智能体集体的一个不可能性定理
The Accountability Horizon: An Impossibility Theorem for Governing Human-Agent Collectives
摘要
现有的AI系统问责框架——法律的、伦理的与监管的——都建立在一个共同假设之上:对于任何重大后果,至少存在一个可识别的人,其参与和预见足以承担实质性责任。本文证明,一旦自主性超过一个可计算的阈值,智能体AI系统对该假设的违背便不再是工程限制,而是数学必然。我们提出人-智能体集体(Human-Agent Collectives),一种对人机联合系统的形式化,其中智能体被建模为共享结构因果模型中的状态-策略元组。自主性通过四维信息论画像(认知、执行、评估、社会)来刻画;集体行为则通过交互图与联合动作空间来刻画。我们通过四个最小性质将正当问责公理化:可归因性(Attributability,责任要求因果贡献)、可预见性界(Foreseeability Bound,责任不能超出预测能力)、非空性(Non-Vacuity,至少一个主体承担非平凡责任)与完备性(Completeness,所有责任必须被完整分配)。我们的核心结果——问责不完备性定理(Accountability Incompleteness Theorem)——证明:对于任何复合自主性超过问责视界(Accountability Horizon)且交互图中包含人-智能体反馈回路的集体,任何框架都无法同时满足这四个性质。这种不可能性是结构性的:若不降低自主性,透明度、审计与监督都无法化解它。在阈值之下,正当框架是存在的,由此确立了一个鲜明的相变。在3,000个合成集体上的实验以零违例证实了全部预测。这是AI治理领域的第一个不可能性结果,确立了一条形式化边界:边界之下现有范式仍然有效,边界之上则需要分布式问责机制。
