论文
提示级差分隐私下的奖励驱动学习
Reward-Driven Learning under Prompt-Level Differential Privacy
摘要
具有可验证奖励的强化学习(RLVR)针对本身可能是机密的问题训练语言模型,并且训练后的模型可以揭示它看到的问题。我们在提示级差分隐私下研究 RLVR:对于任何一个训练问题的存在,发布的权重必须是 (ε,δ) 差分隐私。将对一个提示的一组响应作为隐私记录,我们的方法聚合它们的梯度,将提示的贡献剪辑一次,添加高斯噪声,并在更新过程中构成隐私损失,因此预算既不取决于每个提示的响应数量,也不取决于剪辑规范;据我们所知,这是 RLVR 训练的第一个差分隐私保证。我们使用 LoRA 以 ε=8 的每次运行预算训练 Qwen2.5-1.5B-Instruct,并在相同的提示和相同的预算下比较仅删除奖励信号的控制和两个私人监督的微调配方。对于每个种子,奖励信号在 MATH 上将控制精度提高了 2.65 个点,在 GSM8K 上将控制精度提高了 3.24 个点;这种改进在格式稳健的评分器中仍然存在,数学得分为 1.3 分,并且不能用回答长度来解释。在相同的预算下,私人模型在 MATH 和 GSM8K 上的表现比受监督的方法高出 2.3 到 3.8 个点,在这些任务上保留了非私人 GRPO 的 85--90% 的收益,而在 MATH 上,预算紧缩八倍的噪音最多只增加 1.2 个点。奖励效应也适用于 CommonsenseQA,这是一项探索性的非数学任务。因此,验证者反馈在提示级隐私下仍然是可用的学习信号。