论文

评估 LLM 在 Android 应用程序中的混淆检测和分类

Evaluating LLMs for Obfuscation Detection and Classification in Android Apps

模型评测模型能力评测

摘要

Android 应用程序 (app) 开发人员越来越依赖代码混淆技术来阻碍逆向工程并保护知识产权。然而,混淆也降低了静态分析和漏洞检测工具的有效性,给Android安全分析带来了挑战。检测 Android 应用程序中的混淆的现有方法主要依赖于手工启发式、工程特征或特定于任务的学习管道,这些方法可能很难在不断发展的混淆策略中推广。本文提出了一项大规模实证研究,调查 大语言模型 (LLM) 通过语义推理检测 Android 应用中的混淆的能力。我们的研究评估了现成的 LLM 是否可以在不依赖手工规则、预定义签名或专用 模型训练 的情况下识别混淆代码。实证评估是在包含使用多种技术混淆的应用程序的受控基准测试和从 Google Play 收集的 Android 应用程序的真实数据集上进行的。该研究进一步研究了多个开放权重和专有 LLM 的提示设计、模型选择和决策阈值的影响。最后,该分析将基于 LLM 的推理与现有的基于 SAST 的混淆检测方法进行比较,并讨论将 LLM 应用到 Android 安全分析的更广泛的含义和局限性。