论文

LLM 中无监督推理的自由能量驱动强化学习和自适应优势塑造

Free Energy-Driven Reinforcement Learning with Adaptive Advantage Shaping for Unsupervised Reasoning in LLMs

模型训练强化学习

摘要

无监督强化学习 (RL) 已成为 大语言模型 (LLM) 中实现自我改进的有前途的范例。然而,现有的基于强化学习的无监督方法通常缺乏适应模型在训练过程中不断变化的推理能力的能力。因此,这些方法在缺乏 真值 监督的情况下可能会误导策略优化。为了解决这个问题,我们引入了 FREIA,这是一种基于强化学习的新型算法,它建立在两个关键创新之上:(1)自由能源驱动奖励(FER)根据自由能源原则调整奖励以平衡共识和探索。 (2)自适应优势塑造(AAS)根据采样奖励的统计特征自适应地调整学习信号。对三个推理任务的九个数据集进行的实证评估表明,FREIA 优于其他无监督的基于 RL 的基线。值得注意的是,在数学推理任务中,使用 DeepSeek-R1-Distill-Qwen-1.5B 模型的 FREIA 在 Pass@1 中平均领先其他方法 0.5 至 3.5 分。