论文

RightNow-Arabic-0.5B-Turbo:通过词汇注入和边缘优先部署的开放 Sub-1B 阿拉伯语言模型

RightNow-Arabic-0.5B-Turbo: An Open Sub-1B Arabic Language Model via Vocabulary Injection and Edge-First Deployment

模型优化小模型/轻量模型

摘要

开放阿拉伯语 大语言模型 分为两类:将阿拉伯语视为事后考虑的 sub-1B 多语言模型(Qwen2.5-0.5B、Falcon-H1-0.5B)和需要服务器运行的 7B-70B 阿拉伯语专用模​​型(Jais、AceGPT、ALLaM、SILMA)。曾发表过对 sub-2B 阿拉伯语专用模​​型 Kuwain-1.5B 的尝试,但从未公布其权重。我们推出了 RightNow-Arabic-0.5B-Turbo,这是一款基于 Qwen2.5-0.5B 构建的 518M 参数阿拉伯语专用解码器 LLM。该管道通过平均子词元初始化添加 27,032 个阿拉伯词元,继续使用 FSDP、FlashAttention varlen 打包和 Liger 融合内核对 8xH100 上的 504M 阿拉伯词元进行预训练,然后在 129,116 个阿拉伯指令对上应用受监督的 微调,仅响应损失屏蔽,对 6,750 个阿拉伯偏好对进行直接偏好优化,以及权重汤合并跨越三个检查站。在三个 lm-evaluation-harness 阿拉伯语基准(COPA-ar、Arabic HellaSwag、ArabicMMLU)上,合并模型达到 35.9% 的平均准确度,击败所有同类开放模型,在 COPA-ar 上将 Falcon-H1-1.5B 与 Falcon-H1-1.5B 并列(58.4%),大小仅为 COPA-ar 的三分之一,并在 1/18 参数下恢复 SILMA-9B 平均值的 67%。边缘构建量化为 398 MB (q4_k_m),并通过 llama.cpp 在单个 H100 上以批量大小 1 交付 635 个词元/秒。所有代码(25 个脚本中的 5,555 行)、权重(bf16、int8 和四个 GGUF 量化)和基准脚本均在 https://huggingface.co/RightNowAI/RightNow-Arabic-0.5B-Turbo 上发布。