论文

CoDe-R:通过基本原理指导和自适应推理使用 LLM 细化反编译器输出

CoDe-R: Refining Decompiler Output with LLMs via Rationale Guidance and Adaptive Inference

摘要

二进制反编译是一项关键的逆向工程任务,旨在从剥离的可执行文件中重建高级源代码。尽管大语言模型(LLM)最近表现出了希望,但由于编译过程中不可逆的语义丢失,它们经常遭受“逻辑幻觉”和“语义错位”,导致生成的代码无法重新执行。在本研究中,我们提出了具有鲁棒性的认知反编译器细化(CoDe-R),这是一种轻量级的两阶段代码细化框架。第一阶段引入语义认知增强(SCE),这是一种基本原理引导的语义注入策略,可训练模型以恢复高级算法意图和代码。第二阶段在推理过程中引入动态双路径回退(DDPF)机制,通过混合验证策略自适应地平衡语义恢复和句法稳定性。对 HumanEval-Decompile 基准的评估表明,CoDe-R(使用 1.3B 主干)在轻量级体系中建立了新的最先进 (SOTA)。值得注意的是,它是第一个平均可重复执行率超过 50.00% 的 1.3B 模型,显着优于基准,并有效缩小了高效模型与专家级性能之间的差距。我们的代码可在 https://github.com/Theaoi/CoDe-R 获取。