论文
Rehearse:在自我改进的自动研究中从置信度悬崖退一步
Rehearse: Stepping Back from the Confidence Cliff in Self-Improving Autoresearch
摘要
自动研究(autoresearch)通过提出修改、运行完整训练任务并保留能改进指标的修改来改进机器学习代码。这一循环的效率不仅取决于产生想法,还取决于智能体能否在耗费一次训练之前判断所提修改是否可能奏效。我们研究这种执行前判断的可靠性如何随自动研究轨迹的推进而变化。在公开的AutoSOTA日志(Li et al., 2026;Tsinghua FIB Lab, 2026)中,有益修改的比例从前两次迭代的70%降至第6次及以后迭代的43%。在来自39个论文衍生AutoSOTA任务的296个同基线修改对上——每对包含一个改进指标的修改与一个未改进指标的修改,且实测结果被隐藏——一个仅获得候选理由而无先前尝试历史的LLM裁判,在严格共识给出裁决的对上达到79.5%的准确率。然而,在完整的366对基准上,这种能力在循环后期大幅减弱。随着成功修改不断累积,选择性准确率——即以严格共识裁决为条件的准确率——从82.8%降至56.9%,而裁判仍然愿意作出决定。我们将这种运行模式称为置信度悬崖(confidence cliff)。Rehearse将这一循环改进实现为自动研究循环的一个轻量技能:提出多个想法,在执行前进行比较,运行最有希望的一个,并借助聚焦记忆——对类似过去尝试及其结果的记忆——进行判断。这种聚焦的结果记忆将后期选择性准确率提升至83.5%。在三个循环共4,000次预算内训练运行中,Rehearse在相同训练运行预算下改善了nanochat、图像分类与时间序列预测的终点性能。
