论文

ImproveAnyTask:用于迭代模型自我改进的自治后训练Harness

ImproveAnyTask: An Autonomous Post-Training Harness for Iterative Model Self-Improvement

AI 基础设施AI 开发与运维平台

摘要

使通用大语言模型适应特定任务需要大量的人力来设计数据和训练策略。持续改进尤其具有挑战性,因为模型更新会改变错误分布,需要不断完善策略。我们推出了 ImproveAnyTask,这是一个自主的后训练Harness,可以在有限的计算预算下提高任务性能。 Harness从基于梯度的参数优化中汲取灵感,将适应组织为错误归因、更新方向选择和可执行模型更新。它结合了指标级别和案例级别的分析来确定焦点问题,然后调查研究支持的策略并比较其报告的收益和复制难度。所选策略被转换为训练数据和训练配置,并在完整后训练之前进行小规模执行检查。后续评估指导模型选择和进一步调整,同时保留经过验证的策略和脚本以供重复使用。在 11 项任务中,ImproveAnyTask 在 Base 和 Instruct 模型上的平均增益分别为 18.29 和 11.97 个百分点,在 24 小时预算和相当于 8 个 H20 GPU 的资源下,最大增益为 41.96 个百分点。

ImproveAnyTask:用于迭代模型自我改进的自治后训练Harness的原论文方法或结果图
图 2:ImprovAnyTask 概述。 Harness将任务适应视为迭代优化:评估和双级错误归因识别焦点问题;以研究为基础的策略探索选择更新方向;数据准备和后训练产生候选模型;重新评估确定下一个检查点并记录可复用资产。