论文
范围:LLM 反事实公平性评估的刻板提示数据集
SCOPE: A Dataset of Stereotyped Prompts for Counterfactual Fairness Assessment of LLMs
摘要
大语言模型 (LLM) 现在成为从会话助理到决策支持工具等广泛应用的基础,这使得其结果的公平性问题变得越来越重要。先前的研究表明,当提示引用不同的人口群体时,即使意图和语义内容保持不变,LLM 输出也会发生变化。然而,用于探究这种差异的现有资源主要依赖于小型的、基于模板的反事实示例或固定句子对。这些基准提供有限的语言多样性、狭窄的主题覆盖范围,并且几乎不支持分析交流意图如何影响模型行为。为了解决这些限制,我们引入了 SCOPE(刻板印象评估提示),这是一个反事实提示对的大型数据集,旨在对 LLM 中的群体敏感行为进行系统调查。 SCOPE 包含 241,280 个提示,这些提示被组织成 120,640 个反事实对,每个提示都基于 1,438 个主题之一,涵盖 9 个偏见维度和 1,536 个人口群体。所有提示都是根据四种不同的交流意图生成的:问题、建议、方向和澄清,确保广泛覆盖常见的交互风格。该资源为评估公平性、稳健性和反事实一致性提供了受控的、语义一致的和意图感知的基础。