论文
从特征到动作:传统与Agentic AI系统中的可解释性
From Features to Actions: Explainability in Traditional and Agentic AI Systems
摘要
在过去的十年中,可解释的人工智能主要专注于解释单个模型的预测,产生事后解释,在固定的决策结构下将输入与输出联系起来。大语言模型 (LLM) 的最新进展使得代理人工智能系统成为可能,其行为在多步骤轨迹上展开。在这些环境中,成功和失败是由决策序列而不是单个输出决定的。虽然有用,但目前尚不清楚为静态预测设计的解释方法如何转化为随着时间的推移而出现行为的代理环境。在这项工作中,我们通过比较两种设置中基于归因的解释与基于跟踪的诊断,弥合了静态可解释性和代理可解释性之间的差距。为了明确这种区别,我们根据经验将静态分类任务中使用的基于归因的解释与代理基准(TAU-bench Airline 和 AssistantBench)中使用的基于跟踪的诊断进行比较。我们的结果表明,虽然归因方法在静态设置中实现了稳定的特征排名(Spearman $\rho = 0.86$),但它们无法可靠地应用于诊断代理轨迹中的执行级故障。相比之下,针对代理设置的基于跟踪的评估准则一致地定位了行为故障,并揭示了在失败的运行中状态跟踪不一致的发生率高出 2.7$\times$,并将成功概率降低了 49\%。这些发现促使在评估和诊断自主人工智能行为时,向代理系统的轨迹级可解释性转变。资源: https://github.com/VectorInstitute/unified-xai-evaluation-framework https://vectorinstitute.github.io/unified-xai-evaluation-framework