论文

AxDafny:Dafny中的智能体验证代码生成

AxDafny: Agentic Verified Code Generation in Dafny

摘要

我们研究Dafny中的智能体代码生成——模型必须同时生成可执行代码与用于验证的证明工件。我们提出AxDafny——验证器引导的修复框架——迭代生成实现、不变式、断言与终止性论证。我们还介绍LiveCodeBench-Pro-Dafny(LCB-Pro-Dafny)——将250道竞赛式编程问题翻译为带形式规约与基于验证器的评估工具的Dafny基准。在LCB-Pro-Dafny上——AxDafny相对基线GPT-5.5表现大幅提升验证成功率。在DafnyBench上——AxDafny取得92.7%验证成功率——超越此前报告的最强证明提示基线6.5个百分点。最后——我们表明验证成功与运行时测试性能度量的是生成代码的不同侧面。

AxDafny:Dafny中的智能体验证代码生成:论文配图
图 2:DafnyBench 上的累积 AxDafny 通过率与跨模型设置的迭代预算。主要反馈增益主要集中在前 5 次迭代中。