论文

所有解释都是错误的,但许多解释都是有用的:用 大语言模型 探索罗生门解释集

All Explanations are Wrong, But Many Are Useful: Exploring the Rashomon Explanation Set with Large Language Models

模型推理推理策略与问题分解

摘要

解释机器学习模型对于决策和消费者信任变得越来越重要,但人们普遍认为这是有代价的:现有的可解释人工智能(XAI)方法一直面临着准确性与可解释性之间的权衡。我们认为,这种权衡并不是根本性的,而是将解释和预测视为独立目标的产物;当正确耦合时,它们会变得互补,因此配备模型来解释自身可以提高而不是降低其准确性。我们引入了罗生门解释范式,它构建了一组忠实的预测指导解释,而不是单个解释,并证明该集合通常是非空的,并且解释保真度限制了它所指导的模型的性能。为了探索这个集合,我们提出了 RashomonLLM,一种解释-预测-反射代理工作流程,通过迭代地将解释与预测对齐来生成自然语言的解释,并且我们证明它收敛并恢复完整的集合。在客户流失分类、临床生存回归和大规模直播日志的工业点击率预测方面,RashomonLLM 在准确性和解释质量方面均显着优于最先进的预测和 XAI 基线,其收益由解释保真度驱动,并且对分布变化、时间分割和种子具有鲁棒性。因此,我们的框架可以提高业务绩效,同时为消费者信任奠定基础。