论文

经由风险感知逐步对齐的受约束语言模型策略优化

Constrained Language Model Policy Optimization via Risk-aware Stepwise Alignment

模型训练偏好优化

摘要

在微调预训练语言模型(LM)使其展现期望行为时,保持对风险的控制对确保安全性和可信度至关重要。大多数现有安全对齐方法(如 Safe RLHF 和 SACPO)通常在风险中性范式下运行,不足以应对偏离参考策略所产生的风险,并且对罕见但可能灾难性的有害行为的鲁棒性有限。为解决这一局限,我们提出风险感知逐步对齐(Risk-aware Stepwise Alignment,RSA),一种新颖的对齐方法,通过利用一类嵌套风险度量,将风险感知显式纳入策略优化过程。具体而言,RSA 将安全对齐表述为 token 级的风险感知受约束策略优化问题,并通过逐步对齐过程求解,得到由嵌套风险度量导出的 token 级策略更新。这一设计带来两个关键好处:(1)缓解模型过度偏离参考策略引发的风险;(2)显式抑制低概率但高影响的有害行为。此外,我们在温和假设下给出策略最优性的理论分析。实验结果表明,我们的方法在实现高水平帮助性的同时确保强安全性,并显著抑制尾部风险,即低概率但高影响的不安全响应。