论文

工程可靠的 编码智能体:围绕模型评估和操作系统系统

Engineering Reliable Coding Agents: Evaluating and Operating the System Around the Model

智能体系统Agent任务评测

摘要

AI 编码智能体 通常作为模型进行评估,但作为系统进行部署。它们的可靠性不仅取决于模型功能,还取决于利用、执行状态、检索、内存和状态管理、权限、审查接口和资源分配。本专着研究了这些边界,并开发了一个可靠地评估和操作 编码智能体 的框架。它通过结构化多词审查、有针对性的更新审核、软件工程覆盖率分析和分布式系统证据合成,综合了 164 篇学术著作、100 条从业者记录、29 条基准记录和 17 条作者系统案例记录。从这些证据来看,许多明显的模型失败源于系统的其他地方,而某一层的改进通常无法传播到端到端的结果。评估和操作被视为依赖链,其中任务构造、执行环境、检索、状态管理、验证或可观察性中的弱点可能会使下游结论无效。该专着提供了 206 个可靠性记录的版本目录:193 个门控实践,其中 56 个深入开发,加上 13 个研究线索;证据分类账;跨代理生命周期的依赖性和修复不对称性的框架;来自所运行的代理系统的测量和故障案例;可运行的评估和可靠性协议;以及五种带有证据图的可重复使用的智能体技能。这些共同提供了一种系统级方法,用于区分模型功能和基础设施影响、设计可防御的评估以及构建在组件发生故障时安全恢复的系统。审查是结构化的而不是详尽的,证据强度因主题而异,结果取决于工作负载和配置。这些方法记录了哪些搜索通道已执行、哪些尚未执行,以及对证据分级声明的限制。