论文
DisaBench:一个针对语言模型中残障伤害的参与式评估框架
DisaBench: A Participatory Evaluation Framework for Disability Harms in Language Models
摘要
面向大语言模型的通用安全基准未能充分评估与残障相关的伤害。我们提出DisaBench:一个由残障人士和红队测试专家共同创建的十二类残障伤害分类体系;一种由该分类体系驱动、在七个生活领域中配对良性提示与对抗性提示的评估方法;以及一个包含175条提示、并对525个提示-回复对带有人工标注标签的数据集。由四位具有残障亲历经验的评估者进行的标注揭示了三个发现:伤害发生率因残障类型而急剧变化,且将在非文本模态中叠加;由术语驱动的伤害受文化和时间约束,而非可普遍评估;标准安全评估能捕获显性失效,却遗漏只有领域专业知识才能识别的隐蔽伤害。残障伤害同时是个人的、交叉性的和由社群定义的:它无法从一个人完整身份的背景中剥离出来,而通用基准会系统性地遗漏它。我们将通过Hugging Face和一个开源红队测试框架发布数据集、分类体系与方法,可直接集成到现有安全流水线中,无需额外基础设施。
