论文
开放式 后训练 的提示级奖励规范
Prompt-Level Reward Specifications for Open-Ended Post-Training
摘要
开放式 后训练 受益于奖励,这些奖励使特定于提示的成功条件变得明确,而不是仅仅依赖于事后标量分数。在指令遵循、写作和决策支持任务中,响应质量取决于当地要求、整体偏好和明确的约束,但现有的奖励方法常常隐含这些标准或仅涵盖狭隘的可验证案例。我们提出了一个即时级奖励规范框架,将奖励规范与奖励计算分开。仅在给出提示的情况下,我们的框架就可以离线构建可重用的任务自适应规则和可执行的硬约束检查器,从而在训练前明确奖励标准,并在轨迹采样过程中可重用。在评分时,工件锚定的评分标准和代码评分与剩余整体质量的独立全局评分相结合,产生针对需求满意度、整体质量和确定性约束的标准化混合奖励。该框架不需要人类偏好注释、参考答案或单独训练的奖励模型。实验表明,由此产生的奖励提高了离线 RM 式响应排名,并支持跨多个开放式基准的在线强化学习。消融进一步表明,评分标准、全局评分和可执行验证提供了补充监督。