论文

当智能体实现系统:关于缺陷、检测与评估严谨性的案例研究

When Agents Implement Systems: A Case Study in Defects, Detection, and Evaluation Rigor

模型评测模型行为与机制分析

摘要

随着 LLM 编码代理越来越多地执行端到端工程工作,我们缺乏对它们如何满足系统级需求的经验表征:模式设计、异步编排、配置正确性和检索过滤权衡。我们提出了一个这样的代理的案例研究,该代理根据详细的预先存在的规范实施多组件数据系统。预先确定存储技术、模式、实体解析算法和检索过滤策略;代理的自主权体现在实施、诊断和修复它引入的缺陷以及交互设计选择方面。在一次会话中,我们对五个此类缺陷进行了分类,按违反约束和检测方法进行分类。我们在公共 HotpotQA 基准上进一步评估该架构中指定的一个检索权衡:在排名之前将候选者限制为图形识别的实体集与未过滤的搜索。我们用基准黄金证据标签代替实体识别,因为我们缺乏运行该阶段的LLM访问权限,并报告标准召回率,而不是基准本身的准确性指标。在针对 2994 个段落的汇集语料库的 1 到 10 和 100 个问题的检索预算中,过滤回忆达到预算为 3 的上限,一旦候选者仅限于黄金段落本身,预计就会达到上限,而未经过滤的搜索即使在预算为 10 的情况下也只能在 69% 的时间内恢复所有所需的证据,这一差距在每个测试的预算中都存在,符号检验 p 小于 0.0001。最后,我们讨论了代理自主权在哪些方面取得了成功,以及需要进行哪些纠正,其中包括一个例子,即声称的性能修复从未根据激发它的回归进行重新测量。