论文
致敬:国防领域大语言模型的基准测试和调整
SALUTE: Benchmarking and Adapting LLMs for the Defense Domain
摘要
国防是一个知识密集型领域,需要准确理解专业术语、理论概念、作战程序和不断发展的军事事件。尽管最近的工作探索了军事应用的语言技术,但现有的工作仍然支离破碎:它们通常是特定于任务的,依赖于有限的适应管道,或者缺乏全面的防御领域评估。在本文中,我们提出了 SALUTE,这是一个用于国防领域基准测试和调整 LLM 的端到端框架。 SALUTE 集成了 Salute-Corpus,这是一个来自开放获取的美国军事理论和政府文件的精选语料库; Salute-Conv,一个来自理论来源和长达十年的国防新闻的基础指令数据集; Salute-Pref,防御感知偏好数据集; Salute-Bench,一个经过严格筛选的基准,用于评估国防领域对条令和国防新闻的理解和推理。基于这些资源,我们通过多阶段的后训练以及持续的预训练、监督微调和偏好调整来训练 Salute-LLM。大量实验表明,Salut-LLM 在保留有竞争力的通用能力的同时,实现了强大的防御领域性能,证明了 SALUTE 作为防御领域 LLM 适配的端到端框架的有效性。