论文

Domyn-Small:欧洲 10B 推理语言模型

Domyn-Small: A European 10B Reasoning Language Model

模型训练预训练

摘要

我们介绍 Domyn-Small,一个在 MIT 许可下发布的 100 亿参数开放权重推理语言模型。 Domyn-Small 是基于 9 万亿个 token 多语言数据的初始 预训练 阶段的产物,随后是用于推理、指令跟踪和上下文扩展的 后训练 管道。对于后者,我们执行了连续 预训练 (CPT) 阶段,将本机上下文窗口加倍到 32K 词元,然后进行 SFT 和以数学为重点的退火运行。最后,RL 阶段包括具有可验证奖励的 GRPO、DPO 和跨五个任务领域的多环境 GRPO 阶段:数学、代码、多项选择 QA、指令跟踪和工具调用。 32K 词元本机上下文通过 YaRN 进行推理时扩展到 128K,并且聊天模板切换可实现双模式推理。与 7--10B 级别的同行模型(Qwen3.5-9B、OLMo-3-7B-Think、Nemotron-Nano-8B、Ministral-3-8B)相比,Domyn-Small 实现了强大的准确性与效率平衡:它产生的词元数量大约是 Qwen3.5-9B 的三分之一,大约是 OLMo-3-7B-Think 的 35% 词元预算 的核心推理基准测试,同时提供强大的指令遵循 (IFEval 79.9) 和竞争性科学推理 (GPQA-Diamond 50.0)。我们与 Domyn Swarm (Apache~2.0) 一起发布了权重和 后训练 配方,Domyn Swarm (Apache~2.0) 是一个开源框架,用于在本计划期间开发并在整个工作中使用的 HPC 集群上可扩展的 LLM 推理。