论文
通过查询条件归因审核Agent操作
Auditing Agent Actions through Query-Conditioned Attribution
摘要
LLM Agent越来越多地通过与用户、策略和外部工具的交互来采取相应的行动。审计这些Agent需要将已实现的操作自动归因于其历史基础。然而,现有的归因公式并没有为不同的审计目标提供特定问题的跟踪。此外,当对行为模型的访问受到限制时(例如,在仅 API 部署中),适用的方法通常依赖于昂贵的输入扰动或完整轨迹的外部 LLM 分析。因此,我们制定了 $\textit{查询条件Agent动作归因},这是一项新任务,它将自然语言审计查询作为输入,并为操作的查询指定方面恢复源和有序中间证据。我们使用 $A^3Bench$ 实例化此任务,这是一个基准,包含 1,396 个跨策略基础、参数来源、故障传播和不安全行为跟踪的审核查询。为了实现高效、特定于查询的归因,我们使用小型开放权重模型作为归因提议者,将查询条件梯度显着性与排名历史单位的查询语义相关性结合起来。我们的提议者始终以比开放权重基线更低的推理成本实现更强的源和证据排名,仅通过两次前向传递和一次后向传递,将源 MRR 提高高达 40.9%,将证据 MAP 提高 42.1%。受控评估证实,我们的提议者通过调整其排名以适应审核查询中的细粒度变化来提高归因特异性。我们的端到端系统建立在提议者集合的基础上,在源准确度方面超越了最强的前沿模型基线(64.5\% vs.\ 60.4\%),同时相对于最快的前沿 API 基线将经验部署延迟减少了 29.9\%。代码和数据将在最终验证和清理后的初步审查期结束后发布。