论文

通过幽默调查《LLM》中对身份的反事实不公平

Investigating Counterfactual Unfairness in LLMs towards Identities through Humor

模型评测鲁棒性、公平性与可信度评测

摘要

幽默是社会认知的一面镜子:我们觉得有趣的事情往往反映了我们是谁以及我们如何评价他人。当语言模型融入幽默时,它们的反应就会暴露出它们从训练数据中内化的社会假设。在本文中,我们通过幽默来研究反事实的不公平性,通过观察当我们在保持其他因素不变的情况下交换谁说话和谁被提及时模型的反应如何变化。我们的框架涵盖三个任务:幽默生成拒绝、说话者意图推断和关系/社会影响预测,涵盖与身份无关的幽默和特定于身份的贬低幽默。我们引入了可解释的偏差指标,用于捕获身份交换下的不对称模式。跨最先进模型的实验揭示了一致的关系差异:由特权演讲者讲的笑话被拒绝的频率高达 67.5%,被判断为恶意的频率高达 64.7%,并且在 5 分制中,社会危害性评分高出 1.5 分。这些模式凸显了敏感性和刻板印象如何在生成模型中共存,使实现公平和文化一致性的努力变得复杂化。