论文

DeFiFlowBench:自然语言 DeFi 工作流程综合中的基准测试和提高安全可执行性

DeFiFlowBench: Benchmarking and Improving Safe Executability in Natural-Language DeFi Workflow Synthesis

模型评测基准与评测资源

摘要

结构上有效的 DeFi 工作流程仍然可以授权昂贵的交易。我们介绍 DeFiFlowBench,这是一个由 207 个团队编写的自然语言 DeFi 工作流程合成提示的基准。它测量图形覆盖率、配置完整性和声明的安全谓词,然后在本地 EVM 上测试支持的交易配置。在固定的 5% 价格影响上限下,直接、受限和少次提示会产生每个配置 14-19 次不安全的保留执行。由报价得出的滑点界限并不能阻止订单本身对价格的影响。我们提出了 Koan-Safe,它结合了仅提示的意图解析器、可替换的生成器以及具有默认安全参数的结构修复。在 75 个保留的工作流程提示中,其混合变体在静态安全代理上的得分为 0.67,而最佳基线的得分为 0.33。 Koan-Safe 在保存的基准输出上没有记录不安全的执行。当禁用强制执行时,匹配候选消融会产生 14-17 次不安全处决。其他测试暴露了默认注入的限制:宽松的现有阈值仍然可以授权不安全的交易。单独评估的政策上限在 36 例诊断网格上解决了这一失败。这些结果支持明确的贸易保护和基于执行的评估,同时区分声明的安全性和一般保证。