论文

回到未来:回归LLM的可读性功能

Back to the Future: Regressing Readability Features from LLMs

模型评测评测方法与指标

摘要

代码可读性支持软件理解、审查和维护。随着 AI 编码智能体的使用越来越广泛,可读代码可以帮助人类审查智能体生成的输出,并帮助智能体在有限的上下文窗口内维护代码。然而,现有的可读性模型并不始终符合人类对数据集的判断。我们引入 BTTF(回到未来),将线性回归与信息论特征配对。 BTTF 没有使用语言模型作为黑盒法官,而是将它们用作测量工具。它结合了传统的代码测量、基于嵌入的语义组织和因果 LM 可预测性,以捕获源结构、语义连贯性和上下文惊喜。我们根据五个公开的人类评级可读性基准和我们手动注释的 MBJP 开发集(总共 1,100 个样本)来评估 BTTF。 BTTF 将平均 Spearman 相关性比最强基线最高提高0.101。在生产代码的 13 个受控可读性降低转换中,它在 Java 中实现了 93.8% 的响应率,在 Python 中实现了 87.6% 的响应率,比 Dorn 快了 14% 和 19.2%。它在本地模型中表现最好,并且在 Java 中落后于最强的云LLM响应 1.7%,在 Python 中落后 5.1%。 direct-LLM基线每次评估平均需要 1,083 个提示token,同时保持不透明。 BTTF 将最先进的基准性能和强大的转换鲁棒性与特征粒度可解释性相结合:每个特征系数在所有评估的模型配置中都与其理论方向效应相匹配。