论文

RSI任务-Harness共进化

Recursive Harness Self-Improvement for Frontier Reasoning Data Synthesis

模型训练智能体系统合成数据智能体自我改进递归自我改进(RSI)

摘要

生成渐难推理问题需要随任务分布演化而自适应的合成程序。现有任务级递归把生成的问题复用为种子,但综合Harness保持不变。我们提出任务-Harness共进化,一个用于推理数据综合的递归Harness自提升(RSI)框架。在线自提升在生成过程中把中间求解失败转化为可复用技能;任务后自提升在每批后修订技能、提示与工作流,仅在成本有界增加的条件下生成更难的有效任务时采纳候选。模型权重与验证判据保持固定。横跨数学、编码与科学,平均求解者准确率在十四轮进化中从100.0%降至54.8%。消融显示两种更新日程结合比固定Harness递归或任一单独日程产生更难的任务。所得数据改善下游SFT与GRPO:在1万条合成数学样例上微调的27B学生在APEX上达到62.5%的mean-16准确率,与精选前沿模型参考相当。这些结果支持在任务之外同步适配综合Harness,以生成更具挑战性且有下游训练价值的数据。