论文

揭秘智能合约审计的代理技能:设计、有效性、行为影响

Demystifying Agent Skills for Smart Contract Auditing: Design, Effectiveness, Behavioral Impact

智能体系统Agent任务评测

摘要

LLM 代理,特别是 Claude Code 和 OpenAI Codex,正在成为超越编码代理的多功能工具。这些代理可以通过技能来增强——可重用的工件,其中包含领域知识、工作流程和工具使用说明。然而,迄今为止,人们对这些技能是如何设计的,或者它们如何影响代理人在实践中的有效性和行为知之甚少。在本文中,我们研究了智能合约安全审计中的这些问题,在这个领域,代理已经表现出了巨大的希望。我们系统地从野外收集了 83 种智能合约审计技能,并在 EVMBench 上跨七种代理模型配置对它们进行了评估。我们的研究考察了三个维度:(i)审计技能的设计特征,包括其结构、知识表示、工作流程和工具依赖性; (ii) 它们在改进漏洞检测方面的有效性; (iii) 它们对智能体执行轨迹的影响。我们发现审计技能大多是轻量级的,但设计上是异构的,涵盖了广泛但不平衡的漏洞类型。它们的有效性主要取决于模型而不是代理工具:Codex/GPT-5.5 取得了最大的收益,将检测分数提高了 22.8%,并获得了 43.2% 的奖励。我们进一步发现技能触发是一个关键瓶颈。触发后,技能会保留共享的六阶段审核工作流程,同时表现出不同的加载模式以及对跨配置的代理行为的不同影响。我们发布我们的技能语料库和工件以支持未来的研究。