论文
生成人工智能中的因果偏差检测
Causal Bias Detection in Generative Artifical Intelligence
摘要
建立在人工智能(AI)之上的自动化系统正日益部署于高风险领域,引发了对公平性以及现实中存在的群体差异被延续的严重关切。在此背景下,因果推断为公平性推理提供了一个有原则的框架,因为它将观测到的差异与底层机制联系起来,并自然地契合人类直觉与法律上的歧视概念。以往关于因果公平性的工作主要关注标准机器学习设定:决策者为结果变量$Y$构建单一预测机制$f_{\widehat Y}$,同时从真实世界继承所有其他协变量的因果机制。然而生成式AI的设定要复杂得多:生成模型可以从任意变量集合上的任意条件分布中采样,隐式地构建其对所有因果机制自身的信念,而非学习单一的预测函数。这一根本差异要求因果公平性方法论的新发展。我们将生成式AI中的因果公平性问题形式化,并在统一的理论框架下将其与标准机器学习设定结合起来。随后我们推导出新的因果分解结果,能够沿(a)不同因果路径以及(b)用生成模型机制替换真实世界机制这两个维度对公平性影响进行细粒度量化。我们建立了识别条件并为所关注的因果量引入高效估计器,通过分析大语言模型在不同数据集上的种族与性别偏差展示了该方法论的价值。