论文

通过大语言模型的三阶段功能分割进行层信息微调

Layer-Informed Fine-Tuning via Three-Stage Functional Segmentation of LLMs

模型训练参数高效训练

摘要

近年来,大语言模型(LLM)在推理任务上的表现非常出色,甚至在各种基准上超越了人类的能力。然而,学术界对于LLM的结构和内部参数如何逐步解决复杂的推理问题仍缺乏清晰的认识。在这项研究中,我们研究了大语言模型在跨语言材料上的推理过程,并提出了这样的假设:大语言模型层次在概念化、推理和文本化方面表现出结构化的分工。基于这一假设,我们引入了一种瓶颈识别机制,使用敏感性分析来查明特定任务最关键的功能阶段。利用这一见解,我们提出了一种新颖的方法,即层通知微调(LIFT),它通过选择性地仅更新这些功能关键层来实现高效且有效的微调。然后我们进行了大量的实验,证明 LIFT 方法不仅加速了训练过程,而且显着提高了模型性能。