论文
Nanbeige4.1-3B:能推理、对齐与行动的小型通用模型
Nanbeige4.1-3B: A Small General Model that Reasons, Aligns, and Acts
摘要
我们提出 Nanbeige4.1-3B,一个统一的通用语言模型,仅以 3B 参数同时实现强大的 agentic 行为、代码生成与通用推理。据我们所知,它是在单一模型中实现这种多样能力的首个开源小语言模型(SLM)。为改进推理与偏好对齐,我们结合逐点(point-wise)与逐对(pair-wise)奖励建模,确保高质量、符合人类偏好的回应。在代码生成方面,我们在强化学习中设计复杂度感知奖励,同时优化正确性与效率。在深度搜索方面,我们进行复杂的数据合成,并在训练中引入轮级监督。这带来稳定的长程工具交互,使 Nanbeige4.1-3B 能够为复杂问题求解可靠地执行多达 600 轮工具调用。大量实验结果表明,Nanbeige4.1-3B 显著优于同规模的先前模型(如 Nanbeige4-3B-2511 与 Qwen3-4B),甚至比 Qwen3-30B-A3B 等大得多的模型表现更好。我们的结果表明,小模型可以同时具备广泛能力与强专精能力,重新定义了 3B 参数模型的潜力。
