论文

SAFARI:经主动调查扩展长程智能体故障归因

SAFARI: Scaling Long Horizon Agentic Fault Attribution via Active Investigation

模型评测上下文与知识记忆评测方法与指标Agent记忆

摘要

随自主智能体应对日益复杂的多步多智能体任务——其执行轨迹已超出最大上下文窗口的约束。当前有效诊断智能体失败的方法把完整轨迹加载进LLM上下文窗口——遭受注意力稀释——并在智能体踪迹不可避免超过上下文上限时失效。为解决——我们介绍SAFARI(经主动调查扩展长程智能体故障归因)——以工具增强的诊断循环取代线性上下文加载的框架。通过为LLM配备读写与搜索轨迹片段的专门工具箱——以及跨轮推理的持久短期记忆(STM)——SAFARI有效把诊断准确率与架构上下文上限解耦。实验表明:SAFARI在1M token预算内较SOTA在Who&When数据集上高出20%——在25K token预算下较SOTA在TRAIL GAIA子集上高出19%。最重要的是——当目标故障位于模型原生上下文窗口5倍之外时——SAFARI仍维持0.58精度——传统评估器在该场景完全失效。

SAFARI:经主动调查扩展长程智能体故障归因:论文配图
图 1:SAFARI 主动调查循环的图示。