论文
通过执行轨迹解释人工智能体
Explaining AI Agents Through Execution Traces
摘要
人工智能体越来越多地部署在现实世界中,它们与外部工具交互,并在有限的人类监督下做出连续决策。这就迫切需要对智能体的行为和原因进行可靠且可审计的解释。然而,传统的可解释人工智能(XAI)方法无法提供此类交互式多步骤系统所需的流程级透明度,从而促使范式转向专门为人工智能体设计的方法。为了解决这一差距,我们提出了一个事后 XAI 框架,该框架将冗长的智能体执行跟踪转换为结构化报告和明确基于其可观察行为的忠实自然语言解释。由于它仅依赖于执行跟踪,因此该框架适用于不同的智能体架构、环境和任务。跨多个基准和架构的人工和自动评估表明,我们的框架产生了高质量、跟踪忠实的解释,同时可靠地识别不受支持的主张、不合理的行为和证据差距,优于简单的大语言模型生成的解释。
