论文

解释黑盒语言模型:学习优化语言结构的单词子集

Explaining Black-Box Language Models: Learning to Optimize Linguistically-Structured Word Subsets

模型评测模型行为与机制分析

摘要

随着深度语言模型 (DLM) 越来越多地部署在医疗保健等高风险领域,了解其决策原理对于确保信任、安全和问责制变得至关重要。然而,当这些 DLM 作为黑盒系统(例如通过 API)运行时,实现这种重要的可解释性水平尤其具有挑战性,其中对内部模型状态(例如参数、梯度)的访问受到限制。尽管付出了很多努力,现有的解释方法通常无法同时满足三个关键需求:(i)推理时间效率,(ii)黑盒兼容性而不引起分布外行为,以及(iii)基于输入语言结构的可理解的解释。为了应对这些挑战,我们提出了一种方法,通过选择一小部分信息丰富的输入词子集来解释 DLM 的预测。我们将其表述为摊销优化问题,无需进行特定于输入的搜索即可实现高效的一次性推理。我们的选择策略是通过强化式策略梯度进行训练的,允许在完全无梯度的设置中进行离散单词选择。为了增强可解释性并与人类语言直觉保持一致,我们将图结构知识集成到这个选择过程中,培育语言上连贯的子集,从而为最终用户提供信息丰富且具有认知意义的解释。我们在不同的 DLM 架构和多个真实数据集上评估了我们的方法。它始终如一地识别具有增强的判别力和与语言上显着线索更强的一致性的单词子集,优于传统的黑盒兼容方法和基于梯度的方法,这些方法允许预言机访问黑盒模型的梯度以获得更具挑战性的基准。我们的代码可以在这里找到。