论文

NeoHorse-1:通过具有 Routing Harness 的 Agentic 后训练 实现递归自我改进

NeoHorse-1: Towards Recursive Self-Improvement via Agentic Post-Training with Routing Harness

模型训练监督微调与指令调优

摘要

递归自我改进(RSI)需要一种具体的机制,人工智能系统可以通过该机制观察其能力并将该证据转化为下一轮学习。我们推出了 NeoHorse-1,这是一系列代理原生模型,旨在通过代理 后训练 探索这条道路。我们的系统将异构模型池与智能路由相结合,记录每个用户回合的预测能力需求、选择的服务层级以及后续交互。这些记录被转换为保留交错推理、工具调用和利用上下文的训练示例,并通过结构验证、六维语义评估和子场景级标签被接纳。路由信号将受监督的 微调 组织成一个三阶段课程,并扩展到路由引导的 同策略 蒸馏,其中教师在同一进程下监督学生生成的响应。然后,以能力为导向的分配将评估反馈转换为下一个训练混合物,从而形成一个评估-选择-更新循环,在这个循环中,系统学习到的行为决定了它接下来学到的内容。在涵盖基于Harness的代理、工具使用、编码和指令遵循的 11 个基准测试中,后训练 将 4B 的宏观平均值从 58.94 提高到 64.87,将 9B 的宏观平均值从 65.60 提高到 69.04,大大缩小了训练后的 4B 模型和 9B 基础模型之间的总差距。 NeoHorse-1 提供了这种反馈驱动过程的初始原型,以及通过连续迭代实现利用工具介导的 RSI 的路径。