论文

REFORGE:反编译二进制函数命名中 LLM 逆向工程能力的基准测试方法

REFORGE: A Method for Benchmarking LLMs' Reverse Engineering Capabilities in Decompiled Binary Function Naming

模型评测基准与评测资源

摘要

大语言模型 (LLM) 越来越多地应用于逆向工程任务,最近的威胁情报报告显示它们在实时攻击安全工作流程中运行。然而,对其能力的宣称超出了我们衡量其能力的能力。 LLM 辅助二进制分析的现有基准将函数级 真值 的构造视为已解决的预处理步骤并报告准确性,而没有透露有多少函数是可以可靠评估的。我们认为,公平评估的主要障碍不是模型能力,而是编译器优化下二进制到源代码对齐的可靠性。本文介绍了 Reforge,这是一种来源跟踪管道,它通过编译、DWARF 和句法提取、对齐和反编译从 C 源代码构造函数级 真值,并将对齐不确定性操作为具有三层分层的八门置信漏斗。在受控的微基准上,各个优化级别的高置信度收益率从 87.2% 下降到 65.9%,并且不成对的比较夸大了优化通过生存偏差引起的性能衰减。对七个当代 LLM 在函数命名方面的概念验证评估证明了该概念的有效性,并通常激发了不确定性感知的基准测试实践。