论文
阶段:多偏好 LLM 对齐的受控目标准入
STAGE: Controlled Objective Admission for Multi-Preference LLM Alignment
摘要
多偏好对齐通常被定义为量化:组合奖励维度,然后优化。这使得时间决策未指定:每个偏好维度何时应进入策略优化?我们提出\methodname,一种用于受控目标准入的稳定性引导的主动集控制器。 \methodname 从一个小的活动集开始,保留已承认的目标,并在奖励偏差门表明最近偏差较低或耐心预算耗尽时进行扩展。探测阶段估计难以简单的顺序,自适应加权强调表现不佳的活动维度。使用 15 个训练偏好和 16 个保留基准列进行的自动评估表明,\methodname 获得的平均值高于同步标量化和共享预算调整基线。组件消融和扩展动态进一步支持累积保留、门控准入和探测派生排序作为此设置中有用的设计选择。这些结果将目标进入时间定位为奖励向量 RLHF 中的具体控制变量。