论文
ImproveAnyTask:用于迭代模型自我改进的自治后训练Harness
ImproveAnyTask: An Autonomous Post-Training Harness for Iterative Model Self-Improvement
摘要
使通用大语言模型适应特定任务需要大量的人力来设计数据和训练策略。持续改进尤其具有挑战性,因为模型更新会改变错误分布,需要不断完善策略。我们推出了 ImproveAnyTask,这是一个自主的后训练Harness,可以在有限的计算预算下提高任务性能。 Harness从基于梯度的参数优化中汲取灵感,将适应组织为错误归因、更新方向选择和可执行模型更新。它结合了指标级别和案例级别的分析来确定焦点问题,然后调查研究支持的策略并比较其报告的收益和复制难度。所选策略被转换为训练数据和训练配置,并在完整后训练之前进行小规模执行检查。后续评估指导模型选择和进一步调整,同时保留经过验证的策略和脚本以供重复使用。在 11 项任务中,ImproveAnyTask 在 Base 和 Instruct 模型上的平均增益分别为 18.29 和 11.97 个百分点,在 24 小时预算和相当于 8 个 H20 GPU 的资源下,最大增益为 41.96 个百分点。
