论文

通过执行轨迹解释人工智能体

Explaining AI Agents Through Execution Traces

模型评测模型行为与机制分析

摘要

人工智能体越来越多地部署在现实世界中,它们与外部工具交互,并在有限的人类监督下做出连续决策。这就迫切需要对智能体的行为和原因进行可靠且可审计的解释。然而,传统的可解释人工智能(XAI)方法无法提供此类交互式多步骤系统所需的流程级透明度,从而促使范式转向专门为人工智能体设计的方法。为了解决这一差距,我们提出了一个事后 XAI 框架,该框架将冗长的智能体执行跟踪转换为结构化报告和明确基于其可观察行为的忠实自然语言解释。由于它仅依赖于执行跟踪,因此该框架适用于不同的智能体架构、环境和任务。跨多个基准和架构的人工和自动评估表明,我们的框架产生了高质量、跟踪忠实的解释,同时可靠地识别不受支持的主张、不合理的行为和证据差距,优于简单的大语言模型生成的解释。

通过执行轨迹解释人工智能体:论文配图
图 2:人类评估者在五个评估维度上提供的 Likert 评分分布。条形图显示“我们的-我们的”、“大语言模型-我们的”和“仅限大语言模型”的每个类别中的回复比例。根据设计,维度 M1-a 不包括仅 LLM 配置。图 3:跨评估维度的 Spearman 相关性。系数是根据成对完整评分计算的:当成对中的至少一个维度仅评估结构化输出时,n=63n=63;当两个维度都评估叙述时,n=89n=89。