论文

WisdomInterrogatory(LuWen):开源法律大语言模型技术报告

WisdomInterrogatory (LuWen): An Open-Source Legal Large Language Model Technical Report

应用与实践行业应用

摘要

大语言模型 在广泛的自然语言处理任务中表现出了卓越的能力,但由于涉及专业术语、复杂的推理要求和快速发展的法律知识,其在法律领域的应用仍然具有挑战性。在本文中,我们提出了WisdomInterrogatory(LuWen),这是一种基于百川基础模型的开源中文法律语言模型,通过三个关键技术建立起来:大规模法律语料库上的连续预训练、精心策划的法律指令数据的监督微调以及与综合法律知识库集成的检索增强生成。我们在跨越预测和生成环境的五个代表性法律任务上对鲁文进行了评估,包括法律判决预测、司法考试、法律文本摘要、法律文章问答和司法判决推理。实验结果表明,LuWen 的性能优于几个强大的基线,证明了我们的方法在使通用语言模型适应法律领域方面的有效性。