论文
CAREF:用于解释 忠实性 的校准感知正则化,无需基本原理监督
CAREF: Calibration-Aware Regularization for Explanation Faithfulness Without Rationale Supervision
摘要
我们引入 CAREF,一个参数高效的 微调 框架,它通过校准感知正则化联合优化预测准确性和解释 忠实性。 CAREF 的核心是通过单个统一损失(用于解释的校准感知正则化 忠实性 (LSCED))将基于熵的校准与 词元级 稀疏性控制结合起来,而不需要基本原理监督。使用 Flan-T5 在四个 NLE 基准(COS-E、ECQA、ComVE、e-SNLI)上进行评估,我们的轻量级 CAREF-AQ 变体仅使用 6.43% 的可训练参数即可获得最佳平均精度 (89.04) 和解释对齐 (81.00 nBERT),性能优于 LoRA 和 AdaLoRA。据我们所知,CAREF 是第一种将熵和稀疏正则化统一到可解释的 LLM 微调 的单个训练目标中的方法。