论文
AxDafny:Dafny中的智能体验证代码生成
AxDafny: Agentic Verified Code Generation in Dafny
摘要
我们研究Dafny中的智能体代码生成——模型必须同时生成可执行代码与用于验证的证明工件。我们提出AxDafny——验证器引导的修复框架——迭代生成实现、不变式、断言与终止性论证。我们还介绍LiveCodeBench-Pro-Dafny(LCB-Pro-Dafny)——将250道竞赛式编程问题翻译为带形式规约与基于验证器的评估工具的Dafny基准。在LCB-Pro-Dafny上——AxDafny相对基线GPT-5.5表现大幅提升验证成功率。在DafnyBench上——AxDafny取得92.7%验证成功率——超越此前报告的最强证明提示基线6.5个百分点。最后——我们表明验证成功与运行时测试性能度量的是生成代码的不同侧面。
