论文

Oyster-II:面向大语言模型建设性安全对齐的强化学习

Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models

模型训练强化学习

摘要

大语言模型(LLM)已在多样应用中展示卓越能力——但保证其同时安全、有用且可信仍是持续挑战。传统以拒答为导向的对齐策略减轻有害内容生成——却系统性地无法服务正当用户需求——常常扣留本可安全且建设性地处理敏感查询底层意图的信息。继承Oyster-I开创的建设性安全范式——超越一刀切拒答走向深思熟虑、面向响应的安全对齐——我们识别其基于监督微调(SFT)方案的两个关键局限:对分布外场景的安全泛化不足——以及我们称为安全思维链(CoT)过泛化的现象——安全导向推理模式被过度应用于良性查询——降低有用性与用户体验。为解决这些局限——我们提出Oyster-II——基于强化学习(RL)的建设性安全对齐框架:采用Zero-RL范式结合多阶段强化学习策略。跨大量基准评估——Oyster-II在安全维度上全面超越Qwen3-14B与其前代Oyster-I——取得与Qwen3-Max和Qwen3.5-397B可比的跨规模性能。

Oyster-II:面向大语言模型建设性安全对齐的强化学习:论文配图
图 10:SERL 总体框架。上图:标准 GRPO 管道。中:SERL 将 rollout 组中的一个在线样本替换为离线锚点 o*o^{*},并通过锚点感知组计算构造差分奖励 Δ=R⁡(o*)−R⁡(oi)\Delta=R(o^{*})-R(o_{i})。底部:黄金标准锚点的离线构建管道——预先注入的拒绝采样产生得分最高的候选 o⋆o^{\star};如果S=1S=1则直接采用,否则进入Lingo-BP迭代细化循环,直到响应达到奖励模型下的最高分。