大语言模型 中的解释公平性:对 LLM 如何证明不同人口群体决策合理性差异的实证分析
Explanation Fairness in Large Language Models: An Empirical Analysis of Disparities in How LLMs Justify Decisions Across Demographic Groups
摘要
大语言模型 (LLM) 越来越多地被部署,不仅用于制定决策,还用于解释决策。虽然人工智能决策公平性已得到广泛研究,但人工智能解释的公平性(LLM 是否证明不同人口群体的决策具有相同的质量、深度、语气和语言复杂程度)却很少受到关注。本文介绍了解释公平分类法(EFT),这是一个由五个正式定义的、可操作的维度组成的框架:冗长差异、情感差异、认知对冲差异、决策相关解释差异和词汇复杂度差异。该分类法在受控实证研究中实例化,涵盖 80 个提示模板、四个相应决策域(招聘、医疗分诊、信用评估、法律判断)和五个 LLM:GPT-4.1、Claude Sonnet、LLaMA 3.3 70B、GPT-OSS 120B 和 Qwen3 32B。引入了两个新颖的黑盒指标:对冲密度得分 (HDS) 和解释 忠实性 代理 (EFP),这是与决策相关的解释变异的启发式指标。在多达 400 个提示对中,所有八个 EFT 指标都显示出统计上显着的差异(Cohen's d 范围从小到大,所有 p_BH < 10^(-62))。模型选择与差异大小密切相关:Qwen3 32B 的详细程度差异比 LLaMA 3.3 70B 大 5.9 倍。两种基于提示的缓解措施显示 EFP 差异显着减少 (78-95%),但对风格维度没有显着影响,这与风格解释不平等被编码在 预训练 分布中且无法仅通过部署级指令解决的假设一致。为解释级公平性审计提供了可重复的测量框架,对人工智能监管和部署实践具有影响。