论文
通过高斯过程进行指令调整的在线数据选择
Online Data Selection for Instruction Tuning via Gaussian Processes
摘要
随着大语言模型(LLM)预训练和微调将重点从数据量转向数据质量,质量数据选择已成为一个关键的研究课题。用于 LLM 训练的现有在线数据选择方法通常是“批次约束的”,限制了随机批次内局部效用的优化。为了克服这个问题,我们提出了 GAIA(通过 GAussian 过程进行全局自适应指令调整),这是一个将数据评估制定为全局估计过程的框架。 GAIA 采用高斯过程回归对语义空间中的连续效用流形进行建模,利用自适应策略融合机制动态优先考虑高效用样本。通过将策略后验更新作为跟踪最佳专家的经典固定份额 Hedge 框架的实例,我们继承了动态遗憾保证,该保证表征了 GAIA 在训练期间非平稳质量分数下的鲁棒性。对三个数据集的实证评估表明,GAIA 显着优于 \greats 等最先进的基线,将我们的方法确立为可扩展且稳健的解决方案,可实现高效的指令调整。