论文

通过行为代理实现模型代码和人类代码可理解性的行为一致性

On Behavioral Alignment of Model-Code and Human-Code Understandability via Behavioral Proxies

模型评测评测方法与指标

摘要

代码的可理解性是软件质量的一个关键方面。先前的研究主要从以人为中心或以代码为中心的角度关注这一属性,而它应该被视为读者与代码之间交互产生的关系属性。随着软件工程中越来越多地采用大型语言模型,我们认为“读者”的概念应该概括为包括人类和模型。基于这种关系视角,我们扩展了代码可理解性的概念,以区分人类代码可理解性和模型代码可理解性,旨在研究两者之间的行为一致性。为此,我们使用先前研究中的数据集,其中包含对不同参与者群体的可理解性的人类评级判断,并评估多个开源和闭源大语言模型。为了实现这种行为一致性,我们引入了模型代码可理解性(BPMU)的四种行为代理: P0,基于以程序理解为中心的问答; P1--P3,基于程序意图摘要(源自我们提出的语义自洽)。我们的研究结果表明,与以前使用的浅层机器学习基线相比,大语言模型表现出与一般人类代码可理解性更强的行为一致性。分层分析进一步表明,模型代码的可理解性与专业开发人员最为一致,但与其他学生群体的关系则明显较差。角色条件提示并不能改善后者的一致性,这表明当前的大语言模型无法准确模仿具有不同专业知识的人类读者的观点。最后,我们证明语义自我一致性是一种可靠且可扩展的度量,可用作量化模型代码可理解性的行为代理,在软件工程研究和实践中具有广泛的影响。