论文
将任务级自然语言先验作为低资源大语言模型训练的学习信号
Task-Level Natural Language Priors as Learning Signals for Low-Resource LLM Training
摘要
当资源匮乏的训练数据不明确或不完整时,大语言模型 (LLM) 往往会陷入困境。任务级自然语言先验可以在此类设置中提供有用的指导,但现有方法通常将这些先验视为输入上下文,而不是训练期间的学习信号。我们提出了先验引导调优(PGT),这是一种将自然语言先验纳入低资源 LLM 训练的辅助学习信号的训练视角。从这个角度来看,我们引入了对比先验指导(CPS),它保持原始监督目标完整,同时添加正和负先验条件辅助损失,以鼓励任务一致的学习并阻止看似合理但具有误导性的替代方案。 AmbiMath、Jigsaw 和 MNLI/HANS 上的实验表明,CPS 相对于简单和快速的微调持续改进。在 AmbiMath 上,CPS 的平均精确匹配准确率达到 97.6%。在 Jigsaw 上,CPS 比标准微调平均 Macro F1 提高了 9.5 个百分点,并且在 1/10 的实验训练数据下略高于全数据普通微调。在 HANS 上,CPS 分别将 LLaMA 3.1 8B 和 Qwen 2.5 7B 的非蕴涵准确率提高了 8.3 个百分点和 5.2 个百分点,同时保持了可比的域内 MNLI 准确度。这些结果支持我们的中心主张:任务级自然语言先验可以为低资源 LLM 训练提供有用的指导作为辅助学习信号。我们的代码和数据将公开。
