论文

通过拉格朗日奖励增强实现安全推理时间对齐

Safe Inference-Time Alignment via Lagrangian Reward Augmentation

模型推理解码与生成控制

摘要

推理时间对齐在解码过程中使用辅助奖励信号引导冻结的语言模型,避免了重复权重更新的成本。然而,现有的推理时间对齐方法通常会优化单个标量分数,因此必须忽略显式安全约束或通过手动调整惩罚进行编码。我们提出了拉格朗日奖励增强(LARA),这是一种安全约束下的通用推理时间对齐框架。从具有奖励模型和成本模型的 KL 正则化约束目标开始,LARA 对约束进行对偶化,并将优化问题简化为非负对偶变量上的一维凸问题。在小型校准集上进行估计,这个双变量定义了一个增强奖励,可以用作现有推理时间对齐方法中的插入评分信号。对于序列级采样方法,例如 Best-of-N 重排序,校准的对偶变量对应于预期成本约束问题的解。对于 词元级 奖励引导解码方法,相同的构造产生原则性的双校准启发式,而不是精确的约束策略保证。我们在序列级和 词元级 推理时间比对方法上评估 LARA,发现 LARA 改善了有用性与无害性的权衡,Best-of-N 在推理时间方法中实现了最佳性能,接近基于微调的直接比对基线。