论文
LLM 回归的预测分布的强化学习
Reinforcement Learning over Predictive Distributions for LLM Regression
摘要
大语言模型 (LLM) 已成为灵活的回归器,能够根据异构输入预测实值量。然而,大多数 LLM 回归目标独立优化预测,通常会产生较差的校准结果。我们引入了分布感知奖励(DAR),这是一个 同策略 强化学习目标,它联合评估由同一输入的多个预测形成的经验预测分布。为了将这个分布级别的目标转化为采样轨迹级别的奖励,我们根据每个预测信用对整体预测分布质量的留一贡献来分配。这鼓励以目标为中心并适当分散的预测。我们评估三种回归设置:综合任务探测插值和外推,以及涉及代码和分子数据的两个现实世界科学任务。在跨任务中,DAR 可以生成更好校准的不确定性估计,同时持续减少预测误差并提高监督 微调 和逐点强化学习的排名质量。总之,这些结果凸显了 LLM 回归的分布感知训练的好处。