论文

OpsLLM:通过多阶段学习构建用于软件操作的 大语言模型

OpsLLM: Construction of Large Language Model for Software Operations with Multi-stage Learning

模型训练强化学习

摘要

在软件运营领域,大语言模型(LLM)越来越受到关注。然而,现有研究由于数据质量低、知识碎片化、学习不足等原因,尚未实现高效有效的端到端智能运算。为了探索 LLM 在软件操作中的潜力,我们提出了 OpsLLM,这是一个特定领域的 LLM,支持基于知识的问答 (QA) 和根本原因分析 (RCA)。此外,我们还公开了专门在软件操作领域构建 LLM 的详细工作流程。首先,引入人机交互机制,从大量操作数据中筛选出高质量数据,并构建 微调 数据集。然后,基于这些数据,进行有监督的微调以实现基础模型。此外,我们在强化学习阶段引入了域过程奖励模型(DPRM),以优化 RCA 任务上微调模型的准确性和可靠性。不同难度任务的实验结果表明,OpsLLMs能够有效地学习并与所注入的操作领域知识保持一致,在准确性上优于现有的开源和闭源LLM,在QA任务上提高了0.2%~11.9%,在RCA任务上提高了8.5%~70.3%,同时表现出很强的可迁移性。此外,我们将开源具有 7B、14B 和 32B 参数的 OpsLLM 的三个版本,以及 15K 微调 数据集。