论文

TLA+-Bench:用于生成自然语言到 TLA 规范的基于执行的基准和数据集

TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation

模型评测基准与评测资源

摘要

大语言模型 越来越多地根据自然语言描述编写 TLA$^{+}$ 正式规范,但进展很难衡量:现有资源通过与参考的相似性或输出是否解析来分级,这两者都没有显示出正确性。我们提出了 TLA$^{+}$-Bench,一个按执行进行评分的数据集和基准。每个金标准规约都会附带一个配置,TLA$^{+}$ 模型检查器在整个可到达的状态空间上运行,准确地确定该规范是否包含配置命名的属性。该数据集包含来自 13 个公共存储库的 403 个模型检查的金标准规约和 897 个仅解析的银标准规约,包含之前的 TLA$^{+}$ 生成数据,并携带来自两个提供商的两种风格的四个模型编写的描述,以及难度和类别标签。我们的主要发现是关于测量本身:精确的预言给出的不是一个正确性数字,而是一个范围。仅改变早期基准未说明的评分选择,在一组固定的模型输出上,正确率移动六倍,从 10.0\% 到 1.7\%;添加接口电源选择(模型被告知配置名称)将范围扩大到十一倍,从 18.7\% 到 1.7\%。我们将此范围称为正确性包络并测量其每个边界。里面的发现是稳定的。每个模型写入有效的 TLA$^{+}$ 的频率远远高于正确的 TLA$^{+}$:默认情况下最强的正确率为 16\%,当给定接口名称时为 26\%,开放模型最多为 1\%,并且正确性会急剧下降。