论文

长程智能体轨迹归因:统一基准与细粒度标注框架

Long-Horizon Agent Trajectory Attribution: A Unified Benchmark and Fine-Grained Annotation Framework

智能体系统Agent任务评测长程任务评测

摘要

大语言模型(LLM)智能体日益通过包含用户指令、工具使用、外部观察和记忆的长程轨迹来运作。现有基准主要评估行为结果,对细粒度归因分析的支持有限。我们提出轨迹归因任务,并为其开发了一个基准与标注框架。该基准在统一的组件模式(schema)下组织异构轨迹,提供主要归因组件的标注,并在适用时提供攻击链与执行链标注。以AgentDojo以及Agent3Sigma的Stage和Canary设置产生的轨迹实例化该基准,得到超过1,300条标注轨迹,覆盖任务对齐动作、不安全动作和安全拒绝。该基准定义两个评估任务——主要归因定位与归因链恢复——并提供基于增量轨迹贡献和组件级留一扰动的参考基线。它涵盖多样的归因场景,包括局部归因、长程归因以及结构化归因链。参考基线结果在不同场景间表现出显著性能差异,初步刻画了该基准的归因难度。除这一初始实例化外,我们发布一个可复用的标注技能,使新智能体模型生成的轨迹能够在同一框架下被标准化、标注和评估。项目资源与后续发布见https://github.com/chenjing-2024/agent-trajectory-attribution。