论文
MEA:奖励驱动的忠实模型解释多智能体系统
MEA: A Reward-Driven Multi-Agent System for Faithful Model Explanations
摘要
近年大量机器学习模型被用于高风险领域,但对依据其预测行动的从业者而言仍大多不透明。事后解释方法提供观察模型行为的透镜,但有效使用需要多数领域专家缺乏的专业能力:驾驭高维输出、挑选最佳解释并跨异构工具综合证据。为此我们提出MEA,一个完全移除解释知识壁垒的多Agentic智能体框架:Proposer智能体依据问题与模态选择并配置解释工具;Actor智能体针对忠实度端到端优化,把输出转化为基于模型行为的自然语言解释,覆盖表格、文本与视觉模态。我们还引入特征归因、反事实推理与伪特征检测等多样问题类型,各配扰动式忠实度度量。我们发现前沿LLM系统性地产出不忠实解释;通过以模态自适应惩罚增强的忠实度奖励优化,MEA在六个数据集上持续优于事后解释器、智能体与闭源基线,奖励驱动优化相对未训练骨干带来+28%(表格)、+21%(文本)与+34%(视觉)的忠实度增益。更广地,结果表明AI智能体本身可作为可扩展、可适配的机器学习可解释性接口,为超越固定单一用途工具的自然语言可解释性开辟道路。