论文
VibeCheck:评估 LLM 生成的单元测试的质量:跨异构存储库的多代理实证研究
VibeCheck: Assessing the Quality of LLM-Generated Unit Tests: A Multi-agent Empirical Study across Heterogeneous Repositories
摘要
基于 LLM 的 IDE 代理越来越多地用于生成基于存储库的单元测试,但常见的评估通常依赖于执行成功或覆盖率。这些指标可能会错过更深层次的质量问题,例如弱断言、丢失边缘情况、隔离性差和可维护性有限。本文介绍了 VibeCheck,这是一项针对 15 个学生开发的 Python 和 JavaScript/TypeScript 存储库生成单元测试的实证研究。我们使用 Claude Sonnet 4.5 作为底层代理,在仅存储库、零样本条件下使用涵盖可运行性、断言强度、逻辑和边缘情况覆盖、隔离/确定性和可维护性的五维规则来评估 Kiro、Antigravity 和 Cursor。我们还应用留一法跨代理同行评估来比较工具并识别故障模式。结果显示出明显的执行充分性差距:生成的测试通常可以运行,但经常缺乏强有力的断言和有意义的行为覆盖。弱断言和丢失边缘情况比阻塞故障更常见,这表明可运行的测试仍然很浅。 VibeCheck 提供了一个面向可靠性的框架,用于评估 LLM 生成的测试,超越通过/失败结果。