论文

探索为领域特定文本到代码生成定制语言模型的不同方法

Exploring different approaches to customize language models for domain-specific text-to-code generation

摘要

大语言模型(LLM)已展现出从自然语言描述生成可执行代码的强大能力。然而,在必须使用领域专用库、API或约定的专业编程情境中,通用模型常常表现不佳。定制较小的开源模型为替代依赖大型专有系统提供了高性价比选择。在本工作中,我们研究如何利用合成数据集使较小的语言模型适配领域特定代码生成。我们在Python生态内构建了覆盖三个领域的编程练习数据集:通用Python编程、Scikit-learn机器学习工作流,以及基于OpenCV的计算机视觉任务。利用这些数据集,我们评估三种定制策略:少样本提示、检索增强生成(RAG),以及采用低秩适配(LoRA)的参数高效微调。性能评估同时采用基于基准的指标和衡量与领域专用代码对齐程度的相似性指标。结果显示,少样本学习和RAG等基于提示的方法能以高性价比方式提升领域相关性,但对基准准确率的影响有限。相比之下,基于LoRA的微调在大多数任务上稳定取得更高准确率和更强的领域对齐。这些发现凸显了在将较小语言模型适配到专业编程任务时,灵活性、计算成本与性能之间的现实权衡。

探索为领域特定文本到代码生成定制语言模型的不同方法:论文配图
图 1:定制管道概述。综合编程练习由LLM教师生成,并通过验证阶段进行过滤。生成的数据集用于通过少量提示、RAG 和基于 LoRA 的微调来适应较小的模型。使用基准和相似性度量来评估适应的模型。