论文
什么是好的指令调优数据?情境学习视角
What Makes Good Instruction-Tuning Data? An In-Context Learning Perspective
摘要
指令调优数据集通常包含大量冗余和低质量样本,需要有效的数据选择方法。我们提出了一种基于加权上下文影响(wICI)的指令数据选择框架,该框架衡量每个候选示例如何有效地降低语义相关同伴的指令遵循难度。通过系统实验,我们解决了三个关键问题:从上下文角度来看,什么构成了有效的指令调优数据,样本难度是否与上下文影响相关,以及上下文影响如何转化为指令调优有效性。跨多个模型和基准的实验表明,我们的方法在数据预算有限的情况下始终优于现有基线,同时经验表明样本难度与上下文影响呈负相关。