论文

Chronicle:LLM 代理回归测试的切点重放

Chronicle: Cut-Point Replay for Regression Testing of LLM Agents

智能体系统Agent任务评测

摘要

大型语言模型响应是不确定的,因此 LLM 代理中的故障很难重现:故障取决于不可按位重现的推理、读取变化状态的工具以及重新运行很少重复的多步骤轨迹。记录和重放使运行可重现,但现有的代理工具记录运行只是为了跟踪或评分它们,而不是测试针对它们的代码更改。我们提出 Chronicle,它将在其非确定性边界运行的代理记录为不可变的信封,并从记录中重播它。其核心操作是切点重放,为记录中选定的边界子集提供服务,并使用新代码实时执行补充子集,将记录的事件转变为在持续集成中运行的回归测试。在模拟模型边界的 6 个记录故障的基准上,记录每次交叉增加 23 μs(假设 300 毫秒模型调用的 0.008%),完全重放发出零模型调用,并且在 20 次重复中保持位稳定,切点测试在错误代码上失败,并传递所有 6 个事件的受保护和良性更改。在对受保护工具的突变研究中,切点测试捕获了允许记录的不安全操作通过的每个突变体,而使用相同断言对每个边界进行存根的基线则没有捕获到任何突变体。 Chronicle 和基准测试可在 https://github.com/theagentplane/chronicle 上公开获取。