论文

训练提示事项:稳健 微调 的状态自适应优化

Training Prompt Matters: State-Adaptive Optimization for Robust Fine-Tuning

模型训练监督微调与指令调优

摘要

虽然提示工程有助于在推理过程中最大限度地发挥 大语言模型 (LLM) 的功能,但提示在训练过程中的作用仍未得到充分探索。流行的 微调 范例通常将训练提示视为纯粹的表面形式,假设语义上等效的指令会产生相同的学习结果。然而,我们发现这种等价性是具有欺骗性的:虽然转述的提示通常会导致可比的任务中表现,但它们会在灾难性遗忘和泛化方面引起截然不同的跨任务影响。至关重要的是,这些影响在不同任务之间呈正相关,表明存在能够持续产生更好绩效的高级提示。此外,我们发现这些优秀的提示可以通过学习之前的任务丢失来可靠地识别。利用这些见解,我们引入了状态自适应提示优化(SAPO),这是一种轻量级但有效的训练策略,可将任务制定从静态输入转变为动态的状态自适应变量。对不同基准的综合实验证实了其有效性,它显着减少了遗忘,同时提高了泛化能力,与最先进的方法相比,实现了显着的性能提升。这些结果提供了关于训练提示如何塑造学习动力的见解,并为稳健的 微调 提供了实用的方法。我们的代码可在 https://github.com/Eric8932/SAPO 获取。