论文
VeriScale:用于可验证代码生成的对抗性测试套件扩展
VeriScale: Adversarial Test-Suite Scaling for Verifiable Code Generation
摘要
随着 大语言模型 (LLM) 越来越多地应用于软件工程,构建高质量的基准测试不仅对于评估功能正确性至关重要,而且对于评估生成代码的形式可验证性也至关重要。然而,现有的基准受到正负测试用例的数量和质量的限制,导致模型在生成规范和实现方面的能力被高估。为了解决这个问题,我们提出了 VeriScale,这是一种由对抗性实现驱动的新颖框架。它由两个阶段组成:测试套件扩展以构建多样化且具有挑战性的测试用例,以及测试套件缩减以将它们提炼为紧凑但有区别的套件。虽然 VeriScale 是通用的,但我们在 Verina 上实例化它来构建 VerinaPlus,它将原始测试套件扩展了超过 83$\times$,以及 VerinaLite,一个轻量级的 14$\times$ 变体。我们对八个最先进的 LLM 进行的实验表明,VerinaPlus 暴露了原始基准所隐藏的大量模型弱点,SpecGen 和 CodeGen 任务的得分急剧下降就证明了这一点,而 VerinaLite 以评估成本的一小部分维持了这种判别能力。增强的基准测试和源代码可在 https://github.com/XiaoyangLiu-sjtu/VeriScale 上公开获取。