论文
复杂的智能体,浅层测试:揭秘并增强智能体Harness在野外的测试充分性
Complex Agents, Shallow Tests: Demystifying and Enhancing Test Adequacy of Agent Harness in the Wild
摘要
基于LLM的Agentic系统正在成为一种新的软件范例。现代智能体通常由骨干模型、LLM和周围的Harness组成,用作智能体执行的操作软件基础设施。随着智能体Harness变得越来越复杂,智能体遭受各种Harness实现错误,引发了严重的可靠性问题。在这项工作中,我们进行了首次实证研究,系统地研究了Harness在现实世界Agentic系统中的测试充分性。我们的分析表明,智能体Harness的测试仍然严重不足。特别是,依赖于LLM的Harness (LDH) 代码尽管在处理LLM输出和管理智能体行为方面发挥着关键作用,但受到的测试关注有限,现有测试覆盖的行和分支不到一半。受这些发现的启发,我们进一步提出了HarnessTester,这是第一个面向Harness的测试生成技术,它结合了显式的智能体-Harness合约支持来构建合约忠实的测试设置并广泛运行 LDH 代码。我们的评估表明,HarnessTester 的性能显着优于最先进的通用测试生成技术,可实现 75.95%/84.76% 的线路/分支覆盖率增益和 69.89% 的突变分数增益。此外,HarnessTester 在广泛使用的Agentic系统(例如 OpenClaw)中检测到 122 个真实的Harness错误,其中 88 个错误是以前未知的错误,69 个错误已被智能体开发人员确认。这些结果凸显了HarnessTester 在提高测试充分性和确保实际Agentic系统可靠性方面的实际有效性。
