论文

VibeThinker-3B:探索小语言模型可验证推理的前沿

VibeThinker-3B: Exploring the Frontier of Verifiable Reasoning in Small Language Models

模型优化小模型/轻量模型

摘要

本技术报告介绍VibeThinker-3B——3B参数紧凑稠密模型——开发用于探究在严格小模型机制内可验证推理能推进多远。基于谱到信号后训练范式——我们经优化管线系统增强模型:课程化监督微调、多域强化学习与离线自蒸馏。实验评估表明VibeThinker-3B在极苛可验证任务上取得前沿级性能:AIME26得分94.3(经声明级测试时扩展提升到97.1)、LiveCodeBench v6 Pass@1 80.2——并以96.1%接受率展现对近期未见LeetCode比赛的强分布外泛化。这有效把它放入一线推理系统性能带——匹敌或超越数量级更大的旗舰模型——如DeepSeek V3.2、GLM-5与Gemini 3 Pro。此外——IFEval 93.4分确认该极端推理增强不损害严格指令可控性。延展此前1.5B工作——这些发现激发参数压缩-覆盖假说:可验证推理可压缩进紧凑推理核——而开放域知识与通用能力需要对事实、概念与长尾场景的广泛参数覆盖。该视角提示紧凑模型不只是部署高效的替代品——而是在参数密集能力域通向前沿级性能的互补路径。

VibeThinker-3B:探索小语言模型可验证推理的前沿:论文配图
图 1:VibeThinker-3B 达到 3B 规模的前沿推理性能。 CLR 表示声明级可靠性评估,是一种声明级测试时间扩展策略。