论文
HELIX:面向递归自我改进的模型-运行框架协同进化
HELIX: Model-Harness Co-evolution for Recursive Self-Improvement
摘要
提升Agent能力的工作大多聚焦于改进模型,但交互式Agent是通过一个运行时框架(harness)行动的,该框架中介着上下文、工具、控制流与停止条件。运行框架既决定了模型能完成什么,也塑造了它据以学习的轨迹。这种耦合催生了面向递归自我改进的模型-运行框架协同进化:为固定模型构建运行框架,从经过验证的同类轨迹中更新模型,并随模型能力变化重建运行框架。实现这一循环需要一种受控的运行框架演化方式,同时保持干预的同一性与效果。我们提出HELIX,一个可溯源至源码的运行框架演化基底。HELIX将Agent系统分解为类型化端口、可复用原子、配方(recipe)、产品外壳和运行时策略。它使干预显式且可审计,同时保留轨迹、测试结果与来源信息。运行框架演化由此承担两个相连的角色:改进固定模型下的执行,并产出匹配的成功、回退、近失与备选解,作为后续模型改进的数据。我们在代码修复任务上用一轮演化评估HELIX。一个65个候选的组合发现了一个固定运行框架,使任务覆盖率相比Pi提升4.0%,而完整组合通过互补的同类行为可额外暴露最多58.0%的已验证覆盖率。被选中的候选经重复运行与SWE-bench评估器检验。一个200槽位的同类切片产出438条经验证的SFT、评论、过滤与偏好记录。这些结果显示运行框架、模型与数据如何构成一个反馈系统:运行框架演化扩展当前能力并为下一个模型创造学习信号;模型更新又推动下一轮运行框架演化。HELIX为研究这一递归过程提供了可审计的接口。代码见 https://github.com/HKUDS/HELIX。