论文

迈向忠实的Agentic XAI:提升模型忠实性的验证方法与开放世界基准

Towards Faithful Agentic XAI: A Verification Method and an Open-World Benchmark for Better Model Faithfulness

模型推理推理验证与自校正

摘要

可解释人工智能(XAI)帮助用户解读模型行为并发现潜在故障。Agentic XAI系统利用大语言模型(LLM)通过自然语言交互使解释更易获取,但也可能生成看似合理却不忠实的解释。这一风险源于:针对复杂模型的不可靠XAI输出会被LLM放大并误导用户。我们提出Faithful Agentic XAI(FAX),一个通过显式验证提升解释忠实性的框架。FAX将草稿解释分解为若干论断,并与天然忠实的工具交叉核对,在最终生成前过滤掉无支撑或矛盾的论断。我们还引入CRAFTER-XAI-Bench,一个开放世界强化学习基准,具有复杂策略、多样化目标和具挑战性的场景,用于评估模型特异性忠实性。在CRAFTER-XAI-Bench上,FAX将仿真忠实性从最强基线的0.20提升至0.46,同时保持较高的信息量、相关性与流畅度。在三个表格基准上,FAX与既有Agentic XAI基线表现相当,但我们的分析表明,这些设置会将任务准确率与模型特异性忠实性混为一谈。这些发现表明,显式验证对忠实的Agentic XAI至关重要,且忠实性基准必须设计为对照目标模型自身行为来检验解释。

迈向忠实的Agentic XAI:提升模型忠实性的验证方法与开放世界基准:论文配图
图1:不同XAI方法向用户提供的信息各异,问题类型取自XAIQuestionBank,凸显可验证解释需求的动机。