论文

行动背后的为什么:经Agentic归因揭示内部驱动因素

The Why Behind the Action: Unveiling Internal Drivers via Agentic Attribution

模型评测模型行为与机制分析

摘要

基于大语言模型 (LLM) 的代理广泛应用于客户服务、Web 导航和软件工程等实际应用中。随着这些系统变得更加自主并大规模部署,了解代理为何采取特定行动对于问责和治理变得越来越重要。然而,现有的研究主要集中在 \textit{失败归因} 上,以定位不成功轨迹中的显式错误,这不足以解释代理行为背后的推理。为了弥补这一差距,我们提出了一种新的 \textbf{一般代理归因} 框架,旨在识别驱动代理行为的内部因素,无论任务结果如何。我们的框架分层运行以管理代理交互的复杂性。具体来说,在 \textit{组件级别},我们采用时间似然动态来识别关键的交互步骤;然后在 \textit{句子级别},我们使用基于扰动的分析来完善这种定位,以隔离特定的文本证据。我们在一系列不同的代理场景中验证我们的框架,包括标准工具的使用和微妙的可靠性风险,例如内存引起的偏差。实验结果表明,所提出的框架可靠地查明了代理行为背后的关键历史事件和句子,为迈向更安全、更负责任的代理系统迈出了关键一步。

行动背后的为什么:经Agentic归因揭示内部驱动因素
图2:Agentic Attribution Framework 示意图。该框架以分层方式识别智能体决策。层级1(左):Component-Level Attribution 利用时序似然动态计算每个组件的边际增益,选出能有效引导智能体走向最终动作 a T a_{T} 的高影响组件(如 C 3 C_{3} )。层级2(右):Sentence-Level Attribution 在被识别出的组件内部,通过为每个句子计算基于扰动的分数来执行细粒度分析。