论文

任何可微分目标的合成数据

Synthetic Data for any Differentiable Target

模型训练合成数据

摘要

通过合成训练数据控制语言模型有哪些限制?我们开发了一种强化学习(RL)原语,即数据集策略梯度(DPG),它可以精确优化合成数据生成器以生成目标示例的数据集。当用于目标模型的监督 微调 (SFT) 时,这些示例使目标模型在我们选择的可微指标上表现良好。我们的方法通过高阶梯度获取精确的数据归因并将这些分数用作策略梯度奖励来实现这一目标。我们证明这个过程非常接近合成数据生成器的真实的、难以处理的梯度。为了说明 DPG 的潜力,我们表明,仅在生成的示例上使用 SFT,我们可以使目标模型的 LM 头权重 (1) 嵌入 QR 代码,(2) 嵌入模式 $\texttt{67}$,以及 (3) 具有较低的 $\ell^2$ 范数。我们还表明,我们可以使生成器 (4) 用新语言重新表述输入并 (5) 生成特定的 UUID,即使生成器的输入提示中没有传达这些目标。这些发现表明,DPG 是一种强大且灵活的技术,仅使用合成训练示例即可塑造模型属性。