论文
DART:通过 Distill-Audit-Repair 训练减轻差异感知 LLM 中的危害漂移
DART: Mitigating Harm Drift in Difference-Aware LLMs via Distill-Audit-Repair Training
摘要
为了安全而调整的 大语言模型 (LLM) 通常会避免承认人口统计差异,即使这种承认实际上是正确的(例如,基于血统的疾病发病率)或上下文合理的(例如,宗教雇用偏好)。这种身份盲目性会导致错误的反应、不必要的拒绝或一般的“平等待遇”默认。我们通过差异意识分类来研究这一点:给定一个涉及人口统计群体的问题,任务不是直接回答,而是分类正确答案是否需要识别群体差异(是)或群体是否应该受到相同的对待(否)。至关重要的是,微调 的准确性会引发损害漂移:随着决策准确性的提高,模型生成的解释变得越来越有害,无论是通过阐述有害内容、引入有问题的假设还是未能标记所识别的基准的损害。为了缓解这一问题,我们引入了 DART(蒸馏-审计-修复训练),它从教师那里提取标签条件推理,审核相对于基线的损害漂移案例的输出,并通过严重性加权的 微调 修复有问题的案例。在八个基准测试中,DART 将 Llama-3-8B-Instruct 的准确性从 39.0% 提高到 68.8%,其中平等待遇提示的收益最大 (11.3% -> 72.6%),同时将伤害漂移案例减少 72.6%。它还转移到医疗、法律、政策和教育领域的 280 个开放式现实世界查询,将差异化响应从 39.8% 提高到 77.5%,同时将拒绝率从 34.3% 减少到 3.0%。我们的结果表明,当明确的检测和修复机制到位时,准确性和安全性不会发生冲突。