论文
论大语言模型对代码理解的词汇迷信:对低词汇质量代码的重新评估
On the Lexical Superstition of Large Language Models for Code Comprehension: Re-evaluation on Code of Low Lexical Quality
摘要
大型语言模型 (LLM) 的最新进展使其广泛用于与代码相关的任务。标识符名称在自然发生的代码中具有统计信息,但它们的信息并不总是可靠的。我们调查当前的大语言模型在重命名保留程序结构时是否对词汇线索赋予了不成比例的权重。我们引入了 Face/Off,一种保留语义的标识符重命名框架,并评估跨多个模型和代码理解任务的渐进式命名条件。在此框架内,词汇过度强调在评估的模型和主要任务中普遍存在:随着标识符信息被删除或产生误导,性能通常会下降,并且输出通常针对误导性名称所暗示的含义。这种模式在基于代表性提示和微调的干预下持续存在,表明词汇过度强调是一个根深蒂固的问题。类型推断控制确认了一个边界:当答案在没有目标名称的情况下可以在本地恢复时,命名效果较小。这些结果并不意味着标识符没有帮助;相反,它们揭示了当前大语言模型如何平衡词汇线索与程序结构的系统性漏洞。我们的研究结果激发了评估和建模方法的发展,这些方法保留了自然代码规律的好处,同时保持结论基于准确、形式化的代码语义。