论文
基于SCM的法律文件分类的公平性和忠实可解释性
SCM-based Fairness and Faithful Explainability for Legal Document Classification
摘要
LegalBERT 等 Transformer 模型越来越多地用于法律决策支持,引发了人们对模型解释的公平性和透明度的担忧。这些属性通常是单独评估的,而改变公平性的去偏干预是否也会改变解释反映模型推理的忠实程度,尚无定论。本研究调查了来自 LexGLUE 的 ECtHR 涉嫌违规语料库的这种关系。它将 LegalBERT 基线与公平正则化变体进行比较,该变体在微调过程中惩罚刻板的温暖和能力表示。评估涵盖五个随机种子的预测性能、人口统计公平性和 SHAP 解释忠实度。在性能最优正则化强度下,干预不会减少人口差异。这个空结果适用于两个公平定义和性别轴上的传统词对控制。分类性能基本没有变化。然而,干预持续降低了所有五个种子和三个阈值的解释充分性。混洗对控制再现了这种退化,同时保持性能和公平性不变,表明这种效果来自对比表征正则化,而不是专门来自温暖和能力结构。结果表明,公平性与解释忠实性之间存在分离:解释行为的变化并不一定意味着公平性的变化,因此必须直接评估公平性。