论文
一种算法,两个目标:LLM 微调 中参数和数据选择的双重评分
One Algorithm, Two Goals: Dual Scoring for Parameter and Data Selection in LLM Fine-Tuning
摘要
在 大语言模型 (LLM) 微调 中,参数和数据选择是降低 微调 成本的常见策略,但它们通常由单独的评分机制驱动。当参数掩码和数据子集共同确定受限微调时,这种分离会产生冗余开销并使协调选择变得困难。我们将参数和数据选择视为共同验证目标下的两个双层选择问题,并得出共享的本地响应代理评分规则。在一阶和二阶验证改进近似下,参数重要性和数据效用表现为单个梯度交互矩阵的列式和行式聚合,产生用于共同提取两个信号的封闭形式的行列对应。在此结构的基础上,我们提出了 DualSFT(双重选择 微调),这是一种一次性双重评分算法,可从共享梯度统计中生成参数掩码和数据子集。在 3B-9B LLM 上,单轴 DualSFT 变体增强了比较组内的目标任务性能和稳定性可塑性权衡,而完整的 DualSFT 在匹配预算下比顺序混合基线产生更有利的联合约束权衡。