论文

解释AI的根本局限

Fundamental Limitation in Explaining AI

模型评测模型行为与机制分析

摘要

尽管LLM与扩散模型等大规模模型已取得实际成功,公共机构一直强调AI可解释性的重要性。然而现有的AI解释方法并非为大规模AI系统行为提供完全忠实的解释而设计。尽管对AI系统行为完全忠实且可理解的解释可能对AI治理有用,但提供这种解释在理论上是否可能此前并不清楚。本文数学地证明了AI解释中的一个根本性四难困境:AI及其解释无法同时满足以下四个条件:1)运行环境的复杂性,2)AI性能的优良性,3)AI解释的可解释性,4)AI解释的完全忠实性。这一四难困境表明,在大多数既无法改变环境、也无法牺牲良好AI性能与可解释解释的应用中,我们应放弃解释的完全忠实性,转而只解释对应用重要的部分。由此,该四难困境意味着AI治理应建立在AI解释的忠实性总是不完全的这一前提之上。