论文
宏观:通过偏好对齐优化增强多语言反事实解释
Macro: Enhancing Multilingual Counterfactual Explanations through Alignment-as-Preference Optimization
摘要
自生成的反事实解释 (SCE) 是由 大语言模型 (LLM) 生成的经过最小修改的输入(最小值),它翻转了自己的预测(有效性),提供了一种基于因果关系的方法来解开黑盒 LLM 行为。然而,将它们扩展到英语之外仍然具有挑战性:现有方法很难以非主导语言产生有效的 SCE,而有效性和最小性之间的持续权衡损害了解释质量。我们引入了 Macro,一种偏好对齐框架,它将直接偏好优化 (DPO) 应用于多语言 SCE 生成,使用复合评分函数来构建偏好对,有效地将权衡转化为可测量的偏好信号。跨四种 LLM 和七种类型不同的语言进行的实验表明,Macro 在不降低极简性的情况下,在思想链基线上平均提高了 12.55% 的有效性,同时避免了基于翻译的基线的严重极简性违规。与受监督的 微调 相比,Macro 在两个指标上都实现了卓越的性能,这证实了显式偏好优化对于平衡这种权衡至关重要。进一步的分析表明,Macro 增加了跨语言扰动对齐并减少了常见的生成错误。我们的结果强调偏好优化是增强多语言模型解释的一个有前途的方向。