论文

Hieronym:利用分层多源信息在剥离二进制中重命名函数

Hieronym: Leveraging Hierarchical Multi-Source Information for Function Renaming in Stripped Binary

摘要

剥离二进制文件中的函数重命名可以通过提高代码可读性来极大地帮助逆向工程师,但这是一项具有挑战性的任务。困难源于需要从跨不同指令集、体系结构和编译器优化的低级二进制代码中准确捕获函数语义,并以简洁、人类可读的名称表达这些语义。现有方法要么不足以捕获全面的函数语义,要么对以前未见过的二进制文件表现出有限的泛化能力。在本文中,我们提出了 Hieronym,一种基于生成大语言模型 (LLM) 的框架,用于剥离二进制函数重命名。 Hieronym采用分层摘要驱动的领域适应策略,并集成多源信息,包括全局二进制上下文、本地调用上下文和内在函数语义,以增强LLM对二进制代码的理解。为了实现系统评估,我们进一步提出了一个包含词元级别和全名级别指标的双层评估框架。我们在针对四种架构(x64、x86、ARM 和 MIPS)使用四种编译器优化级别 (O0-O3) 编译的二进制函数上评估 Hieronym。实验结果表明,Hieronym 显着优于最先进的方法,实现了 token 级精度提升 50.12%、召回率提升 41.75%、F1 分数提升 45.10%,名称级准确率提升 79.94%,同时还表现出强大的泛化能力。此外,对现实世界恶意软件样本的实验进一步验证了 Hieronym 在安全关键场景中的实际有效性。