论文

Llama-3.1-FoundationAI-SecurityLLM-Reasoning-8B技术报告

Llama-3.1-FoundationAI-SecurityLLM-Reasoning-8B Technical Report

模型训练强化学习RLVR

摘要

我们提出Foundation-Sec-8B-Reasoning,首个开源网络安全原生推理模型。该模型基于我们先前发布的Foundation-Sec-8B基座模型(源自Llama-3.1-8B-Base),通过结合监督微调(SFT)与可验证奖励强化学习(RLVR)的两阶段过程训练。我们的训练利用了涵盖网络安全分析、指令遵循和数学推理的专有推理数据。跨10个网络安全基准和10个通用基准的评估表明,该模型在网络安全任务上与显著更大的模型性能相当,同时保持强大的通用能力。该模型在多跳推理任务上表现出有效泛化,并在配备适当系统提示和护栏时展现出强大的安全性能。这项工作证明,领域专用推理模型可以在专门任务上取得强劲表现,同时保持广泛的通用能力。我们在 https://huggingface.co/fdtn-ai/Foundation-Sec-8B-Reasoning 公开发布该模型。