论文
Optimsyn:用于综合数据生成的影响引导的量规优化
Optimsyn: Influence-Guided Rubrics Optimization for Synthetic Data Generation
摘要
大语言模型 (LLM) 实现强大的下游性能很大程度上得益于丰富的监督 微调 (SFT) 数据。然而,在人文、社会科学、医学、法律、金融等知识密集型领域,由于专家管理成本高昂、隐私约束严格、标签一致性难以保证等原因,高质量的SFT数据十分稀缺。最近的工作使用合成数据,通常是通过域文档提示生成器并使用手工制作的标题过滤输出。然而,评分标准的设计依赖于专家,跨领域的迁移很差,并且通常通过编写评分标准、综合数据、训练、检查结果和手动猜测修订的脆弱启发式循环来优化。此过程缺乏关于标题如何影响下游绩效的可靠定量反馈。我们建议通过目标模型上的训练效用来评估合成数据,并使用该信号来指导数据生成。受影响估计的启发,我们采用了优化器感知估计器,该估计器使用梯度信息来量化每个合成样本对特定任务的目标模型目标的贡献。我们的分析表明,即使合成样本和真实样本在嵌入空间中接近,它们对学习的影响也可能有很大不同。基于这一见解,我们提出了一个基于优化的框架,该框架使用目标模型反馈来调整评分标准。我们提供轻量级的指导文本,并使用专门的量规模型来生成任务条件量规。影响力分数用作通过强化学习优化评分标准生成器的奖励。跨领域、目标模型和数据生成器的实验显示出一致的改进和强大的泛化能力,无需针对特定任务进行调整。