论文

AutoLLMResearch:训练科研智能体实现LLM实验配置自动化——从廉价中学习,对昂贵进行优化

AutoLLMResearch: Training Research Agents for Automating LLM Experiment Configuration -- Learning from Cheap, Optimizing Expensive

模型训练强化学习

摘要

有效地配置可扩展的大语言模型(LLM)实验——涵盖架构设计、超参数调优及更多方面——对推进LLM研究至关重要,因为糟糕的配置选择会浪费大量计算资源,并使模型无法发挥其全部潜力。已有的自动化方法是为低成本场景设计的,在低成本场景中反复试错是可行的,但可扩展的LLM实验过于昂贵,无法进行如此大量的迭代。据我们所知,尚无工作解决高成本LLM实验配置的自动化问题,这使该问题仍然劳动密集并依赖专家直觉。受这一空白启发,我们提出AutoLLMResearch,一个智能体框架,它模仿人类研究人员如何从低保真实验中学习可泛化的原则,并外推到昂贵LLM场景中高效识别有前景的配置。核心挑战在于如何让智能体通过与捕捉LLM配置空间结构的多保真实验环境交互来进行学习。为实现这一目标,我们提出一个包含两个关键组件的系统化框架:1)LLMConfig-Gym,一个涵盖四项关键LLM实验任务的多保真环境,由超过一百万GPU小时的可验证实验结果支撑;2)一个结构化训练流水线,将配置研究表述为一个长时程马尔可夫决策过程,并据此激励跨保真度外推推理。在保留实验上与多样化强基线的广泛评估证明了我们框架的有效性、泛化性和可解释性,支持其成为可扩展的真实世界LLM实验自动化的实用且通用解决方案的潜力。

AutoLLMResearch:训练科研智能体实现LLM实验配置自动化——从廉价中学习,对昂贵进行优化
图 2:当前方法的局限性、我们的动机以及我们的框架解决的三个挑战的概述。表 1:方法比较。 C1-C3 列对应于简介中提到的三个挑战。只有我们的 AutoLLMResearch 支持通过可验证的 LLM 实验环境 (LLMConfig-Gym) 进行累积体验式学习,并解决交叉保真度转变问题。