论文
用于自动代码审查反馈的 微调 模型
Fine-Tuning Models for Automated Code Review Feedback
摘要
大语言模型 通过个性化支持、内容创建和自动反馈为编程教育引入了新的可能性。虽然最近的研究已经证明了反馈生成的潜力,但许多技术依赖于专有模型,引发了对成本、计算需求以及共享学生代码的道德影响的担忧。 Open LLM 提供了一种替代方法,但它们目前不具备专有模型的功能。为了解决这个问题,我们研究了参数高效的 微调 (PEFT) 和提示工程是否可以用来适应和提高开放 LLM Code Llama 生成的反馈质量,这两者都从大型、功能更强大的模型派生的数据集中提取知识。有缺陷的 Java 代码的反馈质量是通过学生评估、手动注释和自动指标 BLEU、ROUGE 和 BERTScore 的组合来评估的。我们的研究结果表明,PEFT 可以显着提高反馈质量,并且显着优于即时工程,为开发可自由部署的反馈工具提供了途径,这些工具可以有效地用于指导学生学习。学生评价表明,学习者重视 PEFT 模型的反馈,并认为它与专有的 ChatGPT 模型同样有效。与会者建议,在 PEFT 模型的反馈中加入对技术术语的额外解释可能会更有益。这项研究表明,微调模型可以有效支持批判性思维并指导可扩展教学系统的设计。