论文

Bias Ahead:以敏感提示提前识别大模型公平性风险

Bias Ahead: Sensitive Prompts as Early Warnings for Fairness in Large Language Models

模型评测鲁棒性、公平性与可信度评测

摘要

大语言模型 (LLM) 越来越多地集成到软件系统中,提供了强大的功能,但也引发了对公平性的担忧。然而,现有的公平基准侧重于特定的刻板印象关联,这限制了它们在不同的现实世界环境中预测风险的能力。在本文中,我们提出敏感提示作为公平性评估的新抽象:本质上没有偏见的输入,但由于其内容的敏感性,更有可能引起有偏见或不充分的反应。我们构建并发布了 SensY,这是一个包含 12,801 个提示的数据集,分为敏感和非敏感,跨越七个主题领域,结合了合成生成和真实用户输入。使用此数据集,我们查询三个开源 LLM 并手动分析 4,500 个响应,以评估它们在回答敏感提示方面的充分性。结果表明,虽然模型通常提供事实上正确的答案,但它们经常无法承认敏感输入的道德、关系或上下文含义。此外,我们开发了一个自动分类器,用于预测提示敏感性,在敏感提示上实现稳健的性能。我们的研究结果表明,提示敏感性可以作为 LLM 公平风险的有效预警机制。这种观点将公平性评估从被动缓解转向预防性设计,使开发人员能够在部署之前预测和管理偏差。