论文
学习数据选择的多指标权重:具有高效代理的联合任务模型适应框架
Learning Multi-Indicator Weights for Data Selection: A Joint Task-Model Adaptation Framework with Efficient Proxies
摘要
数据选择是 大语言模型 高效指令调整的关键组成部分,最近的研究表明数据质量通常比数据数量更重要。因此,先前的研究引入了各种多维启发式方法来评估和过滤指令数据。然而,大多数现有方法依赖于静态任务不可知和模型不可知的加权方案,忽略了特定下游任务的不同需求以及模型不同的预先存在的能力。在本文中,我们提出了一个学习多指标权重的框架,该框架共同使数据选择适应下游任务和特定模型。我们的方法通过在紧凑的微小验证集上利用上下文学习(ICL)信号来识别最佳权重配置,而无需全尺寸 微调。这些信号充当高效的性能代理,确保以最小的计算成本进行高保真评估。跨多个基准和模型系列(包括 Mistral、Qwen 和 Llama)的实验表明,该方法在 GSM8K 上仅使用 30% 的训练样本时,实现了与全数据集调整相当或超过的性能。此外,我们的分析揭示了推理任务中语义多样性和逻辑复杂性之间的权衡,强调了联合任务模型适应的必要性。