VectraYX-Nano:具有课程学习和本机工具使用的 42M 参数西班牙语网络安全语言模型
VectraYX-Nano: A 42M-Parameter Spanish Cybersecurity Language Model with Curriculum Learning and Native Tool Use
摘要
我们推出了 VectraYX-Nano,这是一种仅包含 41.95M 参数的解码器语言模型,以西班牙语从头开始训练,用于网络安全,重点关注拉丁美洲地区,并通过模型上下文协议 (MCP) 调用本机工具。该模型有四个贡献。 (i) 语料库:VectraYX-Sec-ES,一个 1.7 亿词元的西班牙语语料库,由 8 个虚拟机分布式管道组装而成,云计算费用约为 25 美元,分为三个课程阶段(会话 4200 万、网络安全 11800 万、攻击性工具 1000 万)。 (ii) 架构:具有 GQA、QK-Norm、RMSNorm、SwiGLU、RoPE 和 z-loss 的 42M Transformer 解码器,与域平衡的 16,384 词元字节回退 BPE 配对。 (iii) 跨三个阶段重播的课程产生单调损失下降(9.80 -> 3.17 -> 3.00 -> 2.16);在 SFT(损失 1.74)之后,v2 引导消融参考在 N=4 种子上的 B5 上达到 0.775 +/- 0.043 的对话门,并且受控的 Phase-2 重播扫描超过 {0,5,10,25,50}%,在 >=25% 重播时使 B5 饱和。 (iv) 两个实证结果,均为 N=4。跨 v2 (OpenSubs)、v4 (mC4-ES) 和 v6 (60/25/15 OpenSubs/mC4/Wiki) 的受控引导程序语料库消融暴露了损失与寄存器反转:较低困惑度的引导程序会产生明显更差的会话行为(在每个配对种子的 B5 上 v2 > v4 > v6)。 0.000 的 B4(工具选择)下限是语料库密度工件,而不是容量门:重新平衡 SFT 混合物与工具使用比例 1:21 产生 VectraYX-Nano v7,即已发布的标题配置,在 42M 时达到 B4 = 0.230 +/- 0.052,同时保留 B1 = 0.332 +/- 0.005 和 B5 = 0.725+/-0.130; 260M 从头开始的中间层上的 LoRA 复制达到 0.445 +/- 0.201。发布的 GGUF 在 F16 中大小为 96 MB,在 llama.cpp 下的商用硬件上运行亚秒级 TTFT,据我们所知,这是第一个发布的具有端到端 MCP 集成的西班牙本土网络安全 LLM。