论文

了解模型Harness边界处的代理反应性错误:LLM 代理问题报告的实证研究

Understanding Agent-Reactive Bugs at the Model-Harness Boundary: An Empirical Study of LLM Agent Issue Reports

模型评测模型行为与机制分析

摘要

LLM 代理跨越命令行接口(例如 Codex)和代理框架(例如 LangChain),将后端 LLM 与解析模型输出、控制代理循环和管理上下文的工具代码集成。Harness和 LLM 生成的响应共同塑造代理的执行。这种架构会产生无法通过单独检查任一组件来轻松理解的错误,因为某些错误仅在特定的 LLM 响应引发代理的异常反应时才会发生。之前对代理错误的实证研究主要将失败归因于有限的模型功能或Harness端缺陷,例如过时的 API 和配置不一致,但没有描述这些 AR 错误的特征。我们进行了第一个针对代理反应 (AR) 错误的实证研究。通过对来自 Codex、Gemini-CLI、LangChain 和 CrewAI 的 255 个错误报告进行手动分析,我们构建了一个两轴分类法,涵盖可观察到的症状和触发这些症状的 LLM 行为。我们的研究结果表明,许多 AR 错误表现为无声错误,没有明确定义的测试预言,这使得检测变得困难。 LLM 响应的随机性使错误再现进一步复杂化。我们还检查用户提出的和开发人员实施的修复。此分析暴露了一个不匹配的情况:用户经常主张使用Harness侧护栏,而开发人员可能将问题归因于 LLM 或对用户提出的修复响应缓慢。这些发现表明需要一种机制来帮助用户和开发人员了解 AR 错误的根本原因和解决方案。总体而言,该研究强调了 LLM 代理特有的挑战,并激发了针对 AR 错误的测试预言机、复制支持和故障定位技术的设计。