论文

机器会和人类一样挣扎吗? LLM 和混淆代码的人类理解

Do Machines Struggle Where Humans Do? LLM and Human Comprehension of Obfuscated Code

模型评测模型能力评测

摘要

虽然代码混淆会损害人类代码理解,但目前尚不清楚 大语言模型 是否也有这些故障模式。直接基于最近对代码混淆下的程序理解的人类研究,我们评估了 大语言模型 是否具有混淆在人类程序员中引起的故障模式。使用块模型评估具有五个混淆层的多个 LLM,我们在原子、块、关系和宏观级别上定位理解失败。我们发现,推理调整的模型表现出与不同经验水平的人类难度模式的显着一致性,而指令和编码器调整的模型显示出接近零的相关性。思想链跟踪长度跟踪跨任务的任务难度。结果表明,控制流扁平化下的性能与状态空间复杂性成比例下降,而对抗性标识符重命名通过语义位移和标识符级干扰的相互作用破坏了理解。这些发现表明,推理调整的 LLM 比指令调整的变体更有效地接近人类对代码复杂性的敏感度。