论文
Oyster-II:面向大语言模型建设性安全对齐的强化学习
Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models
摘要
大语言模型(LLM)已在多样应用中展示卓越能力——但保证其同时安全、有用且可信仍是持续挑战。传统以拒答为导向的对齐策略减轻有害内容生成——却系统性地无法服务正当用户需求——常常扣留本可安全且建设性地处理敏感查询底层意图的信息。继承Oyster-I开创的建设性安全范式——超越一刀切拒答走向深思熟虑、面向响应的安全对齐——我们识别其基于监督微调(SFT)方案的两个关键局限:对分布外场景的安全泛化不足——以及我们称为安全思维链(CoT)过泛化的现象——安全导向推理模式被过度应用于良性查询——降低有用性与用户体验。为解决这些局限——我们提出Oyster-II——基于强化学习(RL)的建设性安全对齐框架:采用Zero-RL范式结合多阶段强化学习策略。跨大量基准评估——Oyster-II在安全维度上全面超越Qwen3-14B与其前代Oyster-I——取得与Qwen3-Max和Qwen3.5-397B可比的跨规模性能。
