论文

TinyJudge:通过轻量级专家集成实现无法验证的约束对齐

TinyJudge: Unverifiable Constraint Alignment via Lightweight Specialist Ensembles

模型训练奖励建模与过程监督

摘要

指令跟随(IF)是LLM的核心能力,需要严格遵守各种约束,从可验证的(例如输出长度)到不可验证的(例如音调)。具有可验证奖励的强化学习已成为 IF 任务的范例,利用 LLM 作为法官来评估不可验证的约束。然而,我们凭经验发现这种方法仍然是一个重大瓶颈,遭受严重的 奖励作弊 和更高的计算开销。在这项工作中,我们首先分析了不可验证约束的泛化能力,并发现特定约束表现出独特的、高度泛化的模式。受此启发,我们提出了 TinyJudge,这是一个采用专门的微型语言模型($\sim0.6B$)集合来为软约束提供奖励的框架。通过将前沿模型的专业知识提炼到这些微型模型中,它实现了高精度、轻量级的评估。对五个基准的广泛评估表明,TinyJudge 的平均性能优于基准 $\sim10\%$,奖励精度优于基准 $12\%$。至关重要的是,它还使总训练时间加快了 3 倍。我们的工作为将 LLM 与无法验证的人类指令对齐提供了一条可扩展且强大的路径。