论文

TraceSIR:用于Agentic执行轨迹结构化分析与报告的多智能体框架

TraceSIR: A Multi-Agent Framework for Structured Analysis and Reporting of Agentic Execution Traces

AI 基础设施可观测性

摘要

Agentic系统通过外部工具和迭代决策增强大语言模型,实现深度研究、函数调用和编码等复杂任务。然而,其长而复杂的执行轨迹使失败诊断与根因分析极具挑战。人工检查无法规模化,而把LLM直接应用于原始轨迹则受限于输入长度限制和不可靠的推理。仅关注最终任务结果还会丢弃准确定位问题所需的关键行为信息。为解决这些问题,我们提出TraceSIR,一个用于Agentic执行轨迹结构化分析与报告的多智能体框架。TraceSIR协调三个专用智能体:(1)StructureAgent,引入新颖的抽象格式TraceFormat,在压缩执行轨迹的同时保留关键行为信息;(2)InsightAgent,执行细粒度诊断,包括问题定位、根因分析和优化建议;(3)ReportAgent,跨任务实例聚合洞察并生成综合分析报告。为评估TraceSIR,我们构建了覆盖三个真实Agentic场景的TraceBench,并引入ReportEval——一个与行业需求对齐、评估分析报告质量与可用性的评估协议。实验表明,TraceSIR持续产出连贯、信息丰富且可操作的报告,在所有评估维度上显著优于现有方法。我们的项目与视频已在 https://github.com/SHU-XUN/TraceSIR 公开。

TraceSIR:用于Agentic执行轨迹结构化分析与报告的多智能体框架
图2: TraceSIR 的总体架构。