论文

Solar Open 2 技术报告

Solar Open 2 Technical Report

摘要

我们推出了 Solar Open 2,这是一种专为长期代理任务而构建的 250B-A15B 专家混合语言模型,是从 Solar Open 1(Solar Open 100B)扩展而来的。为了在单一上下文中保持整个智能体轨迹,Solar Open 2 通过混合注意力堆栈达到 1M 词元窗口,该混合注意力堆栈在每三个线性注意力层之间交错一个 softmax 层,不使用位置编码和扩展到负特征值的门控增量规则。为了在固定的计算预算下进行如此规模的训练,我们通过两种方式提高训练效率:更强的起点和更高价值的数据。首先,我们从 Solar Open 1 初始化 Solar Open 2,传输在架构更改中幸存下来的 5.69B 参数共享骨架,并通过完整的 预训练 学习其他所有内容。对于数据,我们策划每个词元的价值:质量和稀有感知的数据策划和混合比优化将 20T 池细化为 10T 混合物,在相同的 词元预算 下,其性能优于 Solar Open 1 配方。为了培养其代理技能,我们在专门构建的场景中训练了 12 名领域专家,然后由多教师 同策略 蒸馏 (MOPD) 将他们整合到一个模型中。与英语基准上的同等大小的开放权重模型相比,Solar Open 2 在 MMLU-Pro、LiveCodeBench 和 APEX-Agents 代理套件上领先,并与其他地方最强的(DeepSeek-V4-Flash 和 MiMo-V2.5)保持竞争力。在韩国基准测试中,Solar Open 2 记录了所有模型中最高的平均值(包括快速封闭 API),而在韩国内部办公代理基准测试 Ko-GDPval 上,它与 DeepSeek-V4-Pro (1.6T) 具有竞争力,但大小还不到 DeepSeek-V4-Pro (1.6T) 的六分之一。