论文

Rehearse:在自我改进的自动研究中从置信度悬崖退一步

Rehearse: Stepping Back from the Confidence Cliff in Self-Improving Autoresearch

上下文与知识记忆Agent记忆

摘要

自动研究(autoresearch)通过提出修改、运行完整训练任务并保留能改进指标的修改来改进机器学习代码。这一循环的效率不仅取决于产生想法,还取决于智能体能否在耗费一次训练之前判断所提修改是否可能奏效。我们研究这种执行前判断的可靠性如何随自动研究轨迹的推进而变化。在公开的AutoSOTA日志(Li et al., 2026;Tsinghua FIB Lab, 2026)中,有益修改的比例从前两次迭代的70%降至第6次及以后迭代的43%。在来自39个论文衍生AutoSOTA任务的296个同基线修改对上——每对包含一个改进指标的修改与一个未改进指标的修改,且实测结果被隐藏——一个仅获得候选理由而无先前尝试历史的LLM裁判,在严格共识给出裁决的对上达到79.5%的准确率。然而,在完整的366对基准上,这种能力在循环后期大幅减弱。随着成功修改不断累积,选择性准确率——即以严格共识裁决为条件的准确率——从82.8%降至56.9%,而裁判仍然愿意作出决定。我们将这种运行模式称为置信度悬崖(confidence cliff)。Rehearse将这一循环改进实现为自动研究循环的一个轻量技能:提出多个想法,在执行前进行比较,运行最有希望的一个,并借助聚焦记忆——对类似过去尝试及其结果的记忆——进行判断。这种聚焦的结果记忆将后期选择性准确率提升至83.5%。在三个循环共4,000次预算内训练运行中,Rehearse在相同训练运行预算下改善了nanochat、图像分类与时间序列预测的终点性能。

Rehearse:在自我改进的自动研究中从置信度悬崖退一步:论文配图
图1:预执行判断迟到失败。根据已累积的成功更改数量 (nbaselinen_{\mathrm{baseline}}) 对 366 对基准进行运行前判断的选择性准确性。我们使用置信悬崖来表示选择性准确率下降而覆盖率却没有下降的情况。如果没有记忆,一旦积累了 3 次或更多成功,选择性准确率就会崩溃 25.925.9 点,而覆盖率(虚线,右轴)从 76%76\% 上升到 85%85\%;重点商店的选择准确度为 83.5%83.5\%,但覆盖率却较低。