论文
无悔的隐私:差分隐私推理时间对齐
Privacy Without Regret: Differentially Private Inference-Time Alignment
摘要
Best-of-N (BoN) 采样是最简单且部署最广泛的推理时间对齐策略,但它存在两个不同的问题:奖励作弊,其中所选响应利用代理奖励模型中的错误,以及用于训练奖励模型的敏感人类偏好数据缺乏任何隐私保护。我们证明,在选择之前添加校准噪声来奖励分数的单一干预可以解决这两个问题。我们的第一个结果,Private Best-of-N (PrivBoN),确定适当规模的 Gumbel 噪声同时提供 $ε$ 差分隐私并实现 KL 正则化对齐。每当隐私预算超过临界阈值 $ε^*$ 时,隐私规定的噪声就是遗憾最优正则化,并且隐私施加零额外对齐成本,与 Huang 等人的信息论天际线相匹配。 (2025)。由于 $ε^*$ 取决于未知的覆盖系数,因此我们引入了私有推理时间悲观主义 (PrivITP),它将 $χ^2$ 正则化拒绝采样与两阶段高斯机制相结合。 PrivITP 实现了事后 $(ε,δ)$-DP,其隐私成本与响应数量 $n$ 无关,干净地将正则化参数与隐私参数解耦,并获得了噪声膨胀项的天际线。跨多种语言模型、数据集和奖励模型的实验证实了我们的结果:PrivBoN 和 PrivITP 是单调缩放的(与 BoN 不同,BoN 会降级超过关键 $n$),并且 PrivITP 在同等隐私级别上匹配或优于 PrivBoN,在强隐私制度中收益最大。