论文
AgentPProf:长程AI智能体的语义性能分析器
AgentPProf: Semantic Profiler for Long Horizon AI Agents
摘要
AI智能体越来越多地在数天或数周内协调用户、工具和系统资源。为改进质量、安全性和成本效率,开发者需要确定失败发生在哪里、什么触发了不安全效果,以及哪些任务消耗最多预算,再优化这些任务。系统软件中的性能分析通过汇总资源消耗并归因到相应代码路径定位热点,回答类似问题。但现有智能体观测工具主要关注单次执行的调试和追踪,缺少跨运行的长期分析,因此难以大规模回答上述问题。智能体观测需要性能分析,而不仅是调试;挑战在于责任对象是“诊断认证问题”“比较分支”等任务意图,而不是有稳定聚合标识的代码路径。我们提出语义操作栈模型,将性能分析适配到智能体轨迹。统一操作表示全部活动,操作栈替代运行时调用栈,支持不同粒度的分层归因。我们观察到任务占据连续区段且可分解为子任务,因此提出在任务边界递归切分轨迹的操作分段方法。AgentPProf将轨迹聚合成兼容pprof的性能文件,支持火焰图可视化和分析。在CodeTraceBench上,相对人工标注的B³ F1为0.764。在三个问题定位基准上,这类性能文件使MAP最多提高56%,表明其能够以实用的分析成本进行资源归因、问题定位并辅助优化Token成本。AgentPProf通过文中链接提供。