论文

分析控制流代码反混淆任务中的思想链 (CoT) 方法

Analyzing Chain of Thought (CoT) Approaches in Control Flow Code Deobfuscation Tasks

摘要

代码反混淆是在保留程序原始行为的同时恢复程序的可读版本的任务。在实践中,这通常需要使用复杂且昂贵的分析工具进行数天甚至数月的手动工作。在本文中,我们探索了一种基于思想链 (CoT) 提示的替代方法,其中 大语言模型 通过专为代码分析量身定制的明确的逐步推理进行引导。我们专注于控制流混淆,包括控制流扁平化(CFF)、不透明谓词及其组合,并且我们测量控制流图的结构恢复和程序语义的保留。我们评估了五个最先进的 大语言模型 并表明与简单提示相比,CoT 提示显着提高了反混淆质量。我们在一组不同的标准 C 基准测试上验证我们的方法,并使用控制流图的结构度量和基于输出相似性的语义度量来报告结果。在测试的模型中,通过应用 CoT,GPT5 实现了最强的整体性能,与零样本提示相比,在我们的基准测试中,控制流图重建平均增益约 16%,语义保留平均增益约 20.5%。我们的结果还表明,模型性能不仅取决于混淆级别和所选的混淆器,还取决于原始控制流图的内在复杂性。总的来说,这些发现表明 CoT 引导的 大语言模型 可以作为代码反混淆的有效助手,提供改进的代码可解释性、更忠实的控制流图重建以及更好地保留程序行为,同时可能减少逆向工程所需的手动工作。