论文

通过过程奖励模型进行解码时间去偏差:从受控填充到开放式生成

Decoding-Time Debiasing via Process Reward Models: From Controlled Fill-in to Open-Ended Generation

模型推理解码与生成控制

摘要

大语言模型 从他们接受训练的数据中获取社会偏见,并将这些偏见带入下游应用程序,通常会强化有关性别、种族、宗教、残疾、年龄和社会经济地位的刻板印象。标准修复(对精选数据或带有人工反馈的 微调 进行重新训练)成本高昂,需要访问模型权重,并且存在使模型在其他任务上降级的风险。在本文中,我们采取了不同的路线:我们在解码时对模型进行去偏,将偏差缓解视为对候选标记的结构化搜索,而无需触及模型权重。一个单独的过程奖励模型(PRM)充当法官,对每个候选人的公平性和流畅性进行评分。我们设计了三种日益复杂的方案(Best-of-N 选择、顺序批评和修订以及宪法自我审核),并在涵盖 8 个偏见类别的 200 个英语和乌尔都语即时双语基准的四个模型(GPT-4o-mini、Llama 3.2 3B、Gemma 3 4B、Qwen 2.5 3B)上对其进行评估。事实证明,顺序去偏差是最有效的,它可以将平均偏差分数比基线提高高达 +0.40,同时保持(有时还提高)流畅性。然后,我们将所有三种方案扩展到开放式生成,其中每个词元都会动态消除偏差,并引入一个轻量级偏差防护门,该门仅在可能存在偏差的单词上触发,从而将经过良好校准的模型的开销保持在接近 2 倍。将生成器成本与判断成本分开的正式开销度量表明,Best-of-N 在本机实现中的生成器端实际上是免费的。 GPT-4o-mini 作为强大的专有锚点,确认该框架可随模型功能扩展;这三个开放式重量模型显示了当前小型 LLM 仍在挣扎的地方。