论文

STAIF:面向复杂指令遵循的分阶段优化

STAIF: A Stage-wise Optimization for Complex Instruction Following

模型训练偏好优化强化学习RLVR

摘要

遵循带有多个显式约束的复杂指令仍然是大语言模型(LLM)面临的一项基础性挑战。现有的对齐方法(如DPO)优化整体奖励信号,往往弱化了对单个约束的严格满足,尤其是在分布外或多约束设定下。本文提出STAIF,一个分阶段优化框架,将主观(软)约束的对齐与客观可验证(硬)约束的优化解耦。第一阶段采用带多个负样本的偏好优化以锐化对软约束的敏感性,第二阶段采用可验证奖励强化学习(RLVR)来强制严格遵守硬约束。为支撑该方法,我们构建了STAINSTRUCT,一个包含约31,000条复杂多约束指令的高质量双语(英文、中文)数据集。大量分析验证了STAIF的设计,显示其在代表性基准上相对强基线取得最先进性能,并具备真正的泛化能力。

STAIF:面向复杂指令遵循的分阶段优化:论文配图
图 1:StaIF 图示:第 1 阶段软约束对齐;第 2 阶段硬约束验证。