论文

从指标到改进:研究软件质量的生命周期感知 LLM 反馈框架

From Metrics to Improvement: A Lifecycle-Aware LLM Feedback Framework for Research Software Quality

模型推理推理验证与自校正

摘要

研究软件在科学工作流程中越来越重要,但它通常是由软件工程专业知识有限的研究人员开发的。这可能会导致质量问题,从而影响可维护性、可重复性、重用性和可持续性。现有的静态分析工具可以识别此类问题,但其输出通常需要专家解释,并且为将质量评估转化为可行的改进提供有限的支持。为了解决这一差距,我们提出了一个生命周期感知框架,它将定量软件质量评估与基于 大语言模型 (LLM) 的代码细化相结合。该框架包括两个阶段。首先,生命周期感知的质量模型是根据既定的软件质量标准和从业者要求开发的。该模型定义了 5 个质量维度和 25 个候选指标,其中 14 个可使用现有分析工具和自定义测量来实施。其次,所得到的质量诊断结果被用作基于 LLM 的迭代细化流程中的结构化反馈,从而能够根据质量模型反复重新评估生成的改进。我们使用多个 LLM 评估以笔记本为中心的研究软件的框架,并将迭代结构化反馈与单步反馈和非结构化提示进行比较。结果显示了特定质量属性的改进,特别是代码重复和结构质量,同时还揭示了可维护性、代码大小、文档和复杂性之间的权衡。这些发现证明了度量驱动的 LLM 反馈对于研究软件质量改进的潜力,同时强调了其固有的多目标性质 \footnote{源代码和实验数据可在 https://github.com/QCDIS/Software_Quality_Control_LLM 上公开获取。 }