论文

AI 代理质量保证实践和差距的大规模实证研究

A Large-Scale Empirical Study of Quality Assurance Practices and Gaps in AI Agents

模型评测安全与风险评测

摘要

基于大语言模型 (LLM) 的代理越来越多地用于软件工程、网络自动化、研究和生产力应用程序。它们对规划、内存、工具使用、代码执行和外部交互的集成实现了更大的自主性,但也带来了新的可靠性、安全性和安全风险。我们对 157 个基于 LLM 的开源代理项目(至少有 100 个 GitHub star)的质量保证 (QA) 实践进行了大规模实证研究。我们分析文档、源代码、配置和测试,以描述跨执行面、安全措施、测试工件、风险场景和重复出现的差距的 QA 实践。我们发现当前的质量保证主要关注基本功能和高风险操作,而覆盖范围仍然分散。保护措施在等效执行路径上的应用不一致,测试很少检查边界、对抗性或多步骤工具使用失败,并且已识别的风险很少转化为端到端 QA 检查。这些发现强调需要超越功能级测试,转向系统化的端到端验证,以确保代理工作流程在与不受信任的输入、工具、持久状态和外部 API 交互时保持在预期边界内。