论文
扩展视野,而不是参数:使用 35B 代理实现万亿参数性能
Scaling the Horizon, Not the Parameters: Reaching Trillion-Parameter Performance with a 35B Agent
摘要
我们引入了 Agents-A1,这是一个 35B 专家混合代理模型,通过扩展代理范围来达到万亿参数级性能。我们从两个角度研究代理范围扩展:扩展长范围轨迹和扩展异构代理能力。为了支持这一目标,我们构建了一个长期知识行动基础设施,连接外部知识、行动、观察和验证者结果,产生平均长度为 45K 词元的代理轨迹。在此基础上,我们采用三阶段配方来训练 Agents-A1。首先,我们执行全域监督 微调 以使基本模型与广泛的代理行为保持一致。其次,我们训练领域级教师模型以获取每个领域的专业知识。第三,我们提出了一种多教师域路由的 同策略 蒸馏 ,具有显着的词汇对齐功能,以提高跨不同域的知识转移效率,将六个异构域统一到一个可部署的学生模型中。 Agents-A1 在长期代理基准测试中实现了强大而广泛的性能。与Kimi-K2.6、DeepSeek-V4-pro等1T参数模型相比,Agents-A1在SEAL-0(56.4)、IFBench(80.6)、HiPhO(46.4)、FrontierScience-Olympiad(79.0)、MolBench-Bind(56.8)上取得领先成绩,并在SciCode上保持强劲竞争力(44.3)、HLE (47.6) 和 BrowseComp (75.5)。我们希望这项工作为社区提供了一条使用 35B 代理扩展视野的实用路径,该代理可以在长视野任务上达到或匹配 1T 模型的性能。