论文
超越模式:语言模型中分布式推理的强化学习
Reaching Beyond the Mode: RL for Distributional Reasoning in Language Models
摘要
给定一个问题,语言模型 (LM) 隐式编码可能答案的分布。在实践中,LM 的 后训练 过程经常将此分布压缩为单一主导模式。虽然对于假设一个正确答案的基准式评估来说,这通常不是问题,但许多现实世界的任务本质上涉及多个有效答案或不可减少的不确定性。例如,医疗诊断、模糊的问答以及信息不完整的设置。在这些情况下,我们希望 LM 生成多个似是而非的假设,理想情况下对每个假设都有置信度估计,并且不需要计算密集型重复采样来生成非模态答案。本文描述了一种多答案强化学习方法,用于训练 LM 在推理过程中对多个答案执行分布式推理。我们修改 RL 目标,使模型能够在一次前向传递中显式生成多个候选答案,将推理时间搜索的各个方面内化到模型的生成过程中。在问答、医疗诊断和编码基准方面,我们观察到与单一答案训练的基线相比,多样性、覆盖范围和集合级别校准分数有所提高。与竞争方法相比,使用我们的方法训练的模型需要更少的词元来生成多个答案。在编码任务上,它们也更加准确。这些结果将多答案强化学习定位为推理时间缩放程序(例如 best-of-k)的一种有原则且计算效率高的替代方案。代码和更多信息可以在 https://multi-answer-rl.github.io/ 找到。