论文
LLM 理解的复杂性评估
Complexity-Aware Evaluation of LLM Comprehension
摘要
大语言模型 (LLM) 越来越多地用于需要理解现有源代码的软件工程任务,包括行为预测、功能解释、调试和代码审查。然而,随着源代码结构变得更加复杂,总体基准准确性可以掩盖模型可靠性如何变化。本文提出了一个复杂性感知框架,用于使用圈复杂度、嵌套深度、分支因子和 Halstead 体积来评估 LLM 代码理解。我们通过两个互补的任务来评估 DeepSeek-Coder-V2 和 Llama:对 300 个 Python 函数的自动输入输出预测,以及对 60 个函数的平衡子集的手动评估语义理解。这些功能分为低复杂度、中复杂度和高复杂度频段。 DeepSeek-Coder-V2 的整体自动准确率达到 78.33%,而 Llama 的总体自动准确率为 70.33%。然而,从低复杂度到高复杂度,准确率大幅下降,DeepSeek-Coder-V2 从 93.52% 下降到 52.78%,Llama 从 87.04% 下降到 47.22%。不正确的预测始终与所有四个复杂性指标的较高值相关,并且相关性和逻辑回归分析证实了结构复杂性和正确性之间广泛可比较的负相关性。手动语义理解显示出相同的退化模式,DeepSeek-Coder-V2 的准确率从 100.00% 下降到 75.00%,Llama 从 90.00% 下降到 60.00%。这些发现表明,与单独的总体准确性相比,复杂性感知评估对 LLM 代码理解可靠性提供了更具诊断性的评估。