论文
表面公平?FairGap:大语言模型推荐系统的隐层-输出公平性差距基准
Fair on the Surface? Benchmarking Hidden-Output Fairness Gaps in LLM Recommenders
摘要
针对基于大语言模型的推荐系统的公平性审计大多关注可观测输出,隐含地假设稳定的推荐反映稳定的内部处理。我们通过FairGap挑战这一假设,它是首个在两个层面联合评估推荐公平性的基准:可观测输出偏移(OBS)与隐藏表示偏移(IBS),通过跨性别、年龄和种族的受控反事实身份探针进行测量。两者的关系通过表示-输出对齐(ROA)来概括,并利用象限诊断识别用户层面的隐层-输出不匹配。在三个领域中应用于六个开放权重的大语言模型家族后,FairGap揭示出普遍存在的隐层-输出解耦:ROA很少超过0.22,且相当规模的用户群体在内部表示发生大幅偏移时输出依然稳定,这种模式在结构上是仅输出审计无法检测的。此外,将IBS最多降低8倍的激活引导会同时恶化OBS,表明内部公平与输出层公平之间存在根本性张力,而现有框架无力诊断这一问题。
