论文
Evolution 微调:学习发现 371 项优化任务
Evolution Fine-Tuning: Learning to Discover Across 371 Optimization Tasks
摘要
设计更快的 GPU 内核的经验是否也有助于接近一个长期存在的开放数学猜想?集成到进化搜索中的 大语言模型 (LLM) 最近在优化任务上产生了最先进的解决方案,包括开放数学猜想、GPU 内核设计、科学定律发现和组合难题。为了实现这一目标,之前的工作将搜索支架一次应用于一个目标任务,因此每个新问题都是从头开始解决的,一旦模型完成其尝试,搜索过程中积累的经验就会被丢弃。这使得迭代发展解决方案的能力(例如,知道要改变哪一部分以及如何改变,决定何时回溯)完全在脚手架中而不是在模型本身中。模型本身是否可以获得这种能力并在不同的任务中重用它在很大程度上尚未得到检验。为了解决这个问题,我们引入了 Evolution 微调 (EFT),这是一种中期训练范例,它教会 LLM 通过将进化搜索轨迹转换为监督来跨任务进化解决方案。我们构建了 Finch Collection,一个跨越 10 个域和 371 个优化任务的 156K 轨迹数据集,并对开源 LLM 从 2B 到 9B 参数进行了微调。根据经验,EFT 具有跨任务泛化能力:在 22 个保留任务中,我们的模型平均比基础模型高出 10.22%。此外,当与测试时 RL 配合使用时,我们的模型在两个循环填充任务上达到了最先进的性能,并且在 Erdős 最小重叠问题上优于其基本模型对应项。因此,EFT 充当通用发现代理的“实践阶段”,这些代理不会从头开始解决新问题。