论文
超越文本匹配:面向以人为本的二进制逆向工程的无参考评估
Beyond Text Matching: Towards Reference-Free Evaluation for Human-Oriented Binary Reverse Engineering
摘要
面向人类的二进制逆向工程(HOBRE)旨在将反编译的伪代码转化为更加人类友好的表示形式,从而减轻逆向分析的认知负担并提高效率。然而,可靠地评估 HOBRE 输出仍然是一个基本挑战:人工评估成本高昂、耗时且难以扩展,而现有的自动化指标要么需要可执行的测试用例和运行时环境,而这些环境通常无法用于现实世界的二进制文件,要么依赖于通常无法访问且无法捕获语义等效但词汇不同的输出的高质量源代码引用。尽管 LLM-as-a-Judge 范式自然非常适合 HOBRE 评估,但其有效性仍有待探索。本文首次系统地研究了 HOBRE 的 LLM-as-a-Judge 范式,涵盖三个代表性任务:函数名称恢复、二进制代码摘要和反编译优化。我们推出了 BinJudgeBench,这是第一个基于多维人类判断的专家注释、无参考评估基准,其中 LLM-as-a-Judge 与人类判断的平均相关性达到 63.20%,优于传统自动化指标的 35.04%。通过分析主干网 LLM 的判断配置、提示策略和解码温度,我们发现不存在“一刀切”的配置,因为最佳设置因任务和个体样本而异。为了解决这个问题,我们提出了 BinJudge,它采用轻量级路由机制来自适应地为每个任务和样本选择最佳判断配置。 BinJudge 将与人类专家的相关性提高了 4.5\%-24.7\%,并将 API 成本降低至静态最佳配置的 0.06$\times$-0.84$\times$,为 HOBRE 提供了可扩展、经济高效、高保真的自动化评估方案。