论文
可靠性感知性别歧视检测:将 DPO 与注释器协议和 词元级 置信度评分相结合
Reliability-Aware Sexism Detection: Combining DPO with Annotator Agreement and Token-Level Confidence Scoring
摘要
在线性别歧视的检测仍然是一个悬而未决的问题。性别歧视检测本质上是主观的,但大多数现有系统将多注释器标签减少为单一多数决策,并统一处理所有实例。这忽略了两个信息信号:注释者一致性和模型不确定性。我们提出 RA-DPO(可靠性感知直接偏好优化),它将注释器一致性、模型置信度和 词元级 不确定性信号集成到单个可靠性评分中。 RA-DPO 使用此分数在训练期间选择高价值偏好对并支持推理时弃权,这允许模型以覆盖范围换取准确性。我们在 EXIST 2023 的 6,920 个多语言帖子上评估 RA-DPO,通过 DPO 微调 OpenAI gpt-4o 基础,并在两个开放权重 3B 模型(Llama、Qwen)上进行验证。结果表明,前 30% 最可靠对的训练与全数据 DPO 相匹配,这表明可靠性感知选择可以在不牺牲性能的情况下降低训练成本。推理时,选择性预测在真实协议设置中的覆盖率达到 50% 时达到 96.2% 的准确率,在可部署的预测协议设置中达到 88.7% 的准确率,均超过了 85.3% 的无协议基线。这些结果表明,考虑注释的不确定性对于主观分类中的有效训练和可靠部署都是有益的。