论文

一个例子就足以通过公平基准:重新思考联合大语言模型的公平性评估

One Example Is Enough to Pass Fairness Benchmarks: Rethinking Fairness Evaluation for Aligned LLMs

模型评测鲁棒性、公平性与可信度评测

摘要

警告:本提交内容研究刻板印象和偏见,并包含有毒和令人反感的示例,仅用于说明目的。 BBQ等公平基准已经成为各大车型家族公平性评估的事实上的标准。我们认为这些基准太容易支持它们的作用:在单个 BBQ 示例上使用组相对策略优化 (GRPO) 训练 Qwen 2.5 7B Base,或者将该示例放在上下文中作为上下文学习 (ICL) 的一次性演示,将平均 BBQ 准确率分别从 79.9% 提升到 92.9% 和 99.0%,与大规模 RLHF 对应项 (96.1%) 的差距缩小了 80% GRPO,并通过 ICL 超越它。这些影响在模型系列中普遍存在。交叉条件分析表明,模型生成的推理轨迹带来了改进,一个例子足以引出一种与类别无关的“缺失证据”推理模式。我们认为,烧烤式的多项选择弃权基准衡量的是单一的结构线索,解决这些问题的模型并不能因此变得公平。我们呼吁建立涵盖更广泛公平一致性的评估套件。