论文

超越黑箱:智能体AI工具使用的可解释性

Beyond the Black Box: Interpretability of Agentic AI Tool Use

模型评测模型行为与机制分析

摘要

人工智能代理有望用于高风险的企业工作流程,但可靠的部署仍然有限,因为工具使用故障难以诊断和控制。代理可能会跳过所需的工具调用、不必要地调用工具,或者采取其结果仅在执行后才可见的操作。现有的可观察性方法大多是外部的:提示揭示相关性,评估对输出进行评分,并且日志仅在模型已经采取行动后到达。在长期环境中,这些失败的代价尤其高昂,因为早期的工具错误可能会改变轨迹的其余部分,增加token消耗,并产生下游安全风险。我们引入了一个基于稀疏自动编码器(SAE)和线性探针的机械可解释性工具包。该框架在每个操作之前读取模型状态,并推断是否需要工具以及下一个工具操作可能产生的后果。通过将激活分解为稀疏特征,它可以识别与工具决策最相关的内部层和特征,并通过特征消融来测试它们的功能重要性。我们在 NVIDIA Nemotron 函数调用数据集的多步轨迹上训练探针,并将相同的工作流程应用于 GPT-OSS 20B 和 Gemma 3 27B 模型。目标不是取代外部评估,而是添加一个缺失的层:在行动之前了解模型内部发出的信号的可见性。这有助于揭示代理失败的更深层次原因,特别是在长期运行中,早期的错误可能会重塑代理交互的其余部分。更广泛地说,本文展示了机械可解释性如何支持实际的内部可观察性,以监控代理系统中的工具调用和风险。

超越黑箱:智能体AI工具使用的可解释性
图 1:多步骤代理工具决策的机械监控框架概述。代理轨迹被转换为决策边界上下文,映射到预操作激活,使用稀疏自动编码器进行分解,并在执行之前由工具需求探针(探针 1)和工具风险探针(探针 2)使用。