论文

LongCat-Flash-Thinking-2601技术报告

LongCat-Flash-Thinking-2601 Technical Report

模型训练模型架构MoE强化学习Agentic RL

摘要

我们推出 LongCat-Flash-Thinking-2601,一个 5600 亿参数的开源混合专家(MoE)推理模型,具备卓越的 agentic 推理能力。LongCat-Flash-Thinking-2601 在广泛的 agentic 基准(包括 agentic 搜索、agentic 工具使用与工具集成推理)上于开源模型中取得最先进性能。除基准表现外,该模型展现出对复杂工具交互的强泛化能力以及在嘈杂真实世界环境中的稳健行为。其先进能力源于一个统一训练框架:把领域并行专家训练与后续融合相结合,并覆盖从预训练到后训练的数据构建、环境、算法与基础设施的端到端协同设计。特别是,模型在复杂工具使用上的强泛化能力来自我们对环境扩展与有原则的任务构建的深入探索。为优化长尾、偏斜生成与多轮 agentic 交互,并在跨越 20 多个领域的 10,000 多个环境上实现稳定训练,我们系统扩展了异步强化学习框架 DORA,以实现稳定高效的大规模多环境训练。此外,认识到真实任务本质上有噪声,我们对真实世界噪声模式进行系统分析与分解,并设计有针对性的训练流程,把此类不完美显式纳入训练过程,从而提升真实应用的鲁棒性。为进一步提升复杂推理任务性能,我们引入 Heavy Thinking 模式,通过密集并行思考同时扩展推理深度与宽度,实现有效的测试时扩展。

LongCat-Flash-Thinking-2601技术报告
图1:LongCat-Flash-Thinking-2601 的基准测试性能。