论文

了解现代代理框架中的错误:症状、根本原因和触发条件的研究

Understanding Bugs in Modern Agentic Frameworks: A Study of Symptoms, Root Causes, and Triggering Conditions

模型评测智能体系统Agent Harness模型行为与机制分析

摘要

CrewAI 和 AutoGen 等现代代理框架已发展成为复杂的自主多代理系统,带来的可靠性挑战超出了早期基于管道的 LLM 库的范围。然而,现有的实证研究主要集中在早期的 LLM 库或任务级错误上,而没有探索这些代理框架的独特复杂性。我们对五个代表性代理框架中的 409 个已修复错误进行了全面研究,提出了五层架构抽象。我们的分类法识别了以前未报告的症状类别——意外的执行序列、忽略的用户配置和不完整/不正确的跟踪——并隔离了特定于代理的根本原因,包括模型相关故障、认知上下文管理不善和编排故障。值得注意的是,模型集成层是最容易出现错误的,但在错误修复过程中,测试包含率却极低(47%),揭示了关键的验证差距。尽管设计范式各不相同,但错误症状、根本原因和容易出现错误的组件显示出显着的跨框架一致性(JS 相似度 0.62--0.88)。最后,我们首次对错误触发条件进行系统研究,识别元素配置、输入模式和操作中容易出错的因素组合,并展示其跨框架的可转移性,为测试预言机设计和跨框架基准测试提供基础。