论文

LogicHunter:使用代理 Oracle 测试 LLM 代理框架

LogicHunter: Testing LLM Agent Frameworks with an Agentic Oracle

摘要

LangChain、LlamaIndex 和 CrewAI 等 大语言模型 (LLM) 代理框架已成为为生产型人工智能系统提供动力的关键基础设施,但由于自动化测试中的基本挑战,它们仍然严重缺乏测试。与将崩溃作为可靠预言机的传统软件不同,这些纯 Python 框架中的缺陷表现为普通异常或无声语义故障,从而造成了深刻的预言机模糊性。 Pydantic 模式的严格类型治理和复杂的协议要求导致现有模糊器生成大量无效输入,而传统测试生成器仅生成具有弱回归断言的微不足道的案例,从而加剧了这个问题。我们推出了 LogicHunter,这是一个模糊测试框架,它通过主动的规范感知测试来解决生成和预言的挑战。 LogicHunter 采用规范驱动的生成方式,系统地将形式类型约束与现实世界存储库中的真实使用模式融合在一起,合成结构有效但语义极端的输入,并配备行为探针来暴露无声的故障。为了解决预言机的歧义,我们引入了代理预言机,它通过主动检索文档、导航源代码以及通过具有双层状态管理和双流内存的基于 ReAct 的架构检查运行时状态,超越了被动分类。在对三个广泛部署的框架进行评估后,LogicHunter 发现了 40 个以前未知的错误,其中 30 个已被开发人员确认,26 个已由开发人员修复,而最先进的基线报告最终发现没有错误。 Agentic Oracle 的准确率达到 91.17%,比最佳被动方法的 29.27% 高出 61 个百分点。