论文

及时覆盖充分性

Prompt Coverage Adequacy

模型评测评测方法与指标

摘要

近年来,越来越明显的是,大语言模型 (LLM) 和自主代理通过将重点从编写精确的程序转移到表达意图和目标,提高了软件开发的抽象级别。这种范式转变带来了新的挑战,特别是当提示(而不是代码)成为主要开发工件时应如何指导测试。为了应对这一挑战,我们提出了即时覆盖充分性,这是一种新颖的覆盖标准,旨在支持测试从任务描述生成的代码。提示覆盖充分性与传统代码覆盖率类似,但在 LLM 和基于代理的编程中使用的提示级别上运行。具体来说,它通过利用 LLM 的注意力机制来衡量给定的测试套件满足提示中表达的要求的程度。我们基于注意力增强,在两个数据集和多个 LLM 上评估了该标准的简单实例。我们的结果表明,提示覆盖率与错误检测有效性相关,并且在用于指导测试生成时,可以比传统代码覆盖率多发现 30% 以上的错误。这些发现表明,及时覆盖充分性可以作为开发更适合 LLM 驱动的软件开发新兴范例的测试指标的基础,解决这种新环境中经典覆盖标准的局限性。