论文

Solidity智能合约错误检测零样本推理方法的基准评测

Benchmarking Zero-Shot Reasoning Approaches for Error Detection in Solidity Smart Contracts

模型评测模型能力评测

摘要

智能合约通过编码金融与运营逻辑,在区块链系统中扮演核心角色。但其易受细微安全缺陷影响,带来重大资金损失与信任侵蚀风险。LLM为自动化漏洞检测创造新机会,但不同提示策略与模型选择在真实场景中的有效性仍不确定。本文用400份合约的均衡数据集,在两项任务上评估最先进LLM的Solidity智能合约分析能力:(一)错误检测,模型做二分类判断合约是否有漏洞;(二)错误分类,模型须把所预测问题归入特定漏洞类别。模型以零样本提示策略评估,包括零样本、零样本思维链(CoT)与零样本思维树(ToT)。在错误检测任务中,CoT与ToT大幅提升召回率(常接近约95%–99%),但通常降低精确率,表明决策更敏感、误报更多。在错误分类任务中,Claude 3 Opus在ToT提示下取得最佳加权F1分(90.8),其CoT紧随其后。

Solidity智能合约错误检测零样本推理方法的基准评测
图1:最佳配置(使用Tree-of-Thought的Claude 3 Opus)的混淆矩阵,展示各SWC类别间的混淆情况。