论文

利用 大语言模型 进行晦涩代码文体测量:GPT-3.5 和 GPT-4 的比较研究

Leveraging Large Language Models to Obscure Code Stylometry: A Comparative Study of GPT-3.5 and GPT-4

模型评测模型能力评测

摘要

在快速发展的软件开发领域,分析程序员独特风格特征的代码风格测定在作者归属和网络安全方面发挥着至关重要的作用。人工智能的最新进展,特别是 GPT-3.5 和 GPT-4 等 大语言模型 (LLM),为该领域引入了新的维度,挑战了传统的文体测量技术。本研究调查了 LLM 在保留功能的同时改变代码风格的有效性,并评估了各种提示工程策略的影响。通过全面的实验,我们评估了这些模型如何掩盖风格特征,以避免被经过作者归属训练的随机森林分类器检测到。结果揭示了单次方法和多次方法的有效性之间的显着差异,并强调了详细、结构化提示的重要性。此外,功能保留检查展示了修改后维护代码完整性的挑战。这项研究为作者归属技术相对于先进人工智能功能的稳健性提供了重要见解,为未来的网络安全和软件工程发展提供了信息