论文
PreMaQ:在生成之前预测LLM生成的代码的可维护性相关质量
PreMaQ: Predicting Maintainability-Related Quality of LLM-Generated Code Before Generation
摘要
随着大语言模型(LLM)的代码生成能力越来越强,在软件开发中采用生成的代码不仅需要评估其功能正确性,还需要评估其可维护性相关的质量。如果可以在生成之前评估这种质量,那么开发人员就可以避免生成、审查和丢弃低质量代码的成本。尽管先前的工作表明LLM生成的代码的功能正确性可以提前预测,但仍不清楚可维护性相关的质量是否也可以类似地预测。我们引入了生成前可维护性相关质量预测(PreMaQ),它根据生成前LLM的内部表示来预测生成代码的代码气味分数(CSS)和可维护性指数(MI)。我们的评估涵盖四个开放权重LLM和四个 Python 代码生成基准测试,总共包含 2,695 个任务。我们的结果表明,预测的 CSS 和 MI 与所有 16 个模型基准组合中的观察值一致相关,平均 Spearman 等级相关性分别为 0.57 和 0.65。当用于模型选择时,PreMaQ 实现了 59.5% 的可维护性相关质量改进,该质量改进可通过理想的基于可维护性的选择器实现,而不是随机选择多个模型生成功能正确的代码的任务。结合 PreMaQ 的预测和提示嵌入将这一比例增加到 60.7%,表明这两个信号是互补的。这些发现表明 PreMaQ 可用于预测和提高LLM生成的代码的可维护性相关质量。
