论文
LLM自动化微调的策略积累和引导执行
Strategy Accumulation and Guided Execution for Automated LLM Fine-Tuning
摘要
生成特定于任务的大型语言模型需要通过实验发现有效的训练策略。自动微调系统使该实验变得可行,并且手动工作量大大减少。然而,这些系统是无状态的:每次搜索结束后都会丢弃其发现的策略、数据集见解和超参数结果。每项新任务都必须从冷启动开始重复这种代价高昂的搜索。为了解决这个问题,我们提出了策略累积和引导执行(SAGE),这是一个两阶段框架,可以累积自动微调搜索。在第一阶段,多智能体管道执行基于蒙特卡罗树搜索的探索。并行蒸馏代理提取特定于任务的探索记录和置信度评分的跨任务见解,它们共同构成了结构化的经验存储库。在第二阶段,SAGE 从此存储库中检索相关经验,并选择适用于指导新任务训练的经验。我们在涵盖单类别和跨类别设置的九个看不见的任务上评估 SAGE。在单轮执行中,SAGE 积累的经验将基线的平均相对改进从 3.2% 提高到 15.6%,比没有 SAGE 的相同管道提高了 12.4 个百分点。这些结果表明,持久的策略经验为对未见过的任务进行自动微调提供了有效的指导。