论文

表面公平?FairGap:大语言模型推荐系统的隐层-输出公平性差距基准

Fair on the Surface? Benchmarking Hidden-Output Fairness Gaps in LLM Recommenders

模型评测基准与评测资源

摘要

针对基于大语言模型的推荐系统的公平性审计大多关注可观测输出,隐含地假设稳定的推荐反映稳定的内部处理。我们通过FairGap挑战这一假设,它是首个在两个层面联合评估推荐公平性的基准:可观测输出偏移(OBS)与隐藏表示偏移(IBS),通过跨性别、年龄和种族的受控反事实身份探针进行测量。两者的关系通过表示-输出对齐(ROA)来概括,并利用象限诊断识别用户层面的隐层-输出不匹配。在三个领域中应用于六个开放权重的大语言模型家族后,FairGap揭示出普遍存在的隐层-输出解耦:ROA很少超过0.22,且相当规模的用户群体在内部表示发生大幅偏移时输出依然稳定,这种模式在结构上是仅输出审计无法检测的。此外,将IBS最多降低8倍的激活引导会同时恶化OBS,表明内部公平与输出层公平之间存在根本性张力,而现有框架无力诊断这一问题。

表面公平?FairGap:大语言模型推荐系统的隐层-输出公平性差距基准:论文配图
图1:FairGap的动机。两个反事实推荐提示保持相同的偏好历史与任务,仅改变性别线索。仅基于输出的公平性评估无法区分两种性质截然不同的情况:一种是尽管内部表征相似但推荐输出出现分歧;另一种是尽管内部表征差异显著,输出却仍然足够相似,以致表面上显得公平。