论文

POSTCONDBENCH:形式后条件推理的正确性和完整性基准测试

POSTCONDBENCH: Benchmarking Correctness and Completeness in Formal Postcondition Inference

模型评测基准与评测资源

摘要

形式后置条件精确地描述了程序行为并支持调试、测试和验证,但编写它们需要大量的专业知识和精力。这推动了最近使用 大语言模型 (LLM) 从代码和自然语言工件自动生成后置条件的工作。然而,评估仍然是一个关键瓶颈。现有的基准主要强调有限评估设置下的正确性,通常依赖于表面形状匹配或对小型或合成数据集的手动评估。我们引入了 POSTCONDBENCH,这是一种多语言基准,用于评估实际软件的方法级后置条件生成。 POSTCONDBENCH 包含来自 121 个开源项目的 420 个 Python 和 Java 任务,每个任务都配有专家参与构建的高质量 真值 后置条件集。为了实现自动评估,POSTCONDBENCH 提供了一个可运行的执行环境,并通过缺陷辨别来操作完整性:如果后置条件集被更多有缺陷的实现所违反,则后置条件集会更完整,同时在正确执行时保持满意。使用 POSTCONDBENCH,我们制定了三代设置并评估了五个 SOTA LLM。我们的结果揭示了正确性和完整性之间的巨大差距,并表明存储库级依赖关系和方法复杂性加剧了这种差距。