论文

SCDBench:基于 LLM 的智能合约反编译器的基准

SCDBench: A Benchmark for LLM-Based Smart Contract Decompilers

模型评测基准与评测资源

摘要

智能合约反编译旨在从字节码中恢复高级源代码,但评估反编译器仍然很困难,因为现有研究使用狭窄的数据集、不一致的指标和有限的语义一致性检查。随着 大语言模型 (LLM) 开始生成类似源代码的 Solidity,即使其语义与原始合约不同,这种差距也变得越来越重要,即使它的语义与原始合约不同,它也可以编译并显得合理。我们介绍 SCDBench,这是一个基于 LLM 的智能合约反编译的数据集和基准方法。该数据集包含 600 个真实世界的 Solidity 合约,带有成对的字节码输入、真值 源代码和可重播的语义检查点。 SCDBench 通过四个累积阶段评估反编译器输出:格式完整性、可编译性、应用程序二进制接口 (ABI) 恢复以及通过差异重放实现的语义一致性。我们在零样本反编译设置中评估 Claude Opus 4.7、GPT-5.3-Codex 和 GLM-5,包括带或不带扩展推理的 GLM-5 变体以及零样本编译修复设置。结果表明,前沿 LLM 通常可以生成结构化且可编译的 Solidity,但实现语义一致性还远未解决:性能最好的前沿模型仅完美反编译 42/600 个合约。我们进一步表明,引入相同模型编译修复可以以适度的额外成本显着提高性能。 SCDBench 为严格、可重复的评估建立了共同基础,旨在加速开发可靠的智能合约反编译器,以实现区块链安全性和透明度。