论文
企业NLP中的解释鲁棒性:黑箱模型跨架构评测
Robust Explanations for User Trust in Enterprise NLP Systems
摘要
用户对企业 NLP 的信任越来越需要可靠的解释,但在黑盒部署(仅 API 访问)的常见情况下,部署前验证很困难,其中基于表示的解释器不可行,并且现有研究对于解释在真实用户噪声下是否保持稳定提供的指导有限,特别是当组织从编码器分类器迁移到解码器 LLM 时。为了弥补这一差距,我们提出了一个基于留一遮挡的 词元级 解释的统一黑盒鲁棒性评估框架,并在多个严重级别的实际扰动(交换、删除、洗牌和反向翻译)下用最重要词元的翻转率量化解释鲁棒性。使用该协议,我们对三个基准数据集和跨越编码器和解码器系列的六个模型(BERT、RoBERTa、Qwen 7B/14B、Llama 8B/70B;64,800 个案例)进行系统的跨架构比较。我们发现解码器 LLM 产生比编码器基线更稳定的解释(翻转率平均降低 73%),并且稳定性随着模型规模的增加而提高(从7B到70B稳定性提高44%)。最后,我们将稳健性改进与推理成本联系起来,产生实用的成本稳健性权衡曲线,支持在合规性敏感应用程序中部署之前选择模型和解释。