论文

困惑度可以作为代码可理解性的认知信号吗?

Can Perplexity Serve as a Cognitive Signal for Code Understandability?

模型评测模型行为与机制分析

摘要

最近的研究表明,大语言模型 的 词元级 困惑可以与代码理解过程中人类局部困惑相一致。这就提出了一个自然的问题:困惑度也可以作为代码可理解性的片段级信号吗?我们在多个以人为基础的数据集上对这个问题进行了实证研究,包括方法级可理解性判断、输出预测任务和公认的可理解性改进补丁。尽管有先前的 词元级 证据,但我们发现标记复杂度的简单片段级聚合(例如平均值、中值或峰值困惑度)并不与人类可理解性可靠地相关。然后我们调查为什么会发生这种情况。首先,词元困惑度在代码结构中高度倾斜且重尾;极端峰值不仅来自语义上有意义的结构,还来自标识符、文字、类型、分隔符和标记化工件。其次,人类可理解性标签通常缺乏共识,使得整个片段的难度成为嘈杂的目标。第三,困惑度分布及其与人类难度的一致性在模型和标记器之间存在很大差异。这些发现解释了为什么之前的 词元级 困惑——混淆对齐不会直接转移到片段级别的可理解性。总的来说,我们的研究将困惑定位为一种有前途但微妙的认知信号:对于局部代码混淆有用,但需要代码感知聚合、共识感知评估和模型敏感性分析,然后才能支持可靠的代码可理解性测量。