论文
SmartEval:从自然语言需求评测 LLM 生成智能合约
SmartEval: A Benchmark for Evaluating LLM-Generated Smart Contracts from Natural Language Specifications
摘要
我们引入了 SmartEval,这是一个基准,用于根据自然语言规范系统评估 大语言模型(LLM)生成的 Solidity 智能合约的质量。 SmartEval 提供了包含 9,000 个生成合约的语料库,以及从 FSMSCG 数据集提取的专家编写的 真值 实现、涵盖功能完整性、变量保真度、状态机正确性、业务逻辑保真度和代码质量的五维评估标准,以及可重复的生成和评估管道。为了验证基准的可靠性,我们进行了三项独立的实证研究:五条件消融研究(每个条件 N=300),隔离每个管道组件的贡献;由三名哥伦比亚大学博士研究人员进行的人类专家评估,确认自动得分与专家判断的误差在 0.34 分以内;通过 Slither 静态分析器进行外部安全分析,确认 LLM 审核员与非 LLM 之间的一致性达到 79.4%基于规则的工具。对 9,000 个生成合约的系统分析揭示了典型的故障模式(35.3% 的逻辑遗漏、23.4% 的状态转换错误以及复杂性驱动的退化),并量化了生成的合约相对于 真值 实现的+8.29 综合得分优势,这归因于 LLM 的字面规范遵循行为。 SmartEval为LLM智能合约综合质量的实证研究奠定了可重复、经过验证的基础,所有数据、评估代码和生成的合约均公开发布。