论文
迭代乘法的 RLVR 景观可能是良性的:来自自旋玻璃理论的见解
RLVR landscapes for iterated multiplications can be benign: Insights from spin-glass theory
摘要
尽管具有可验证奖励的强化学习(RLVR)很重要,但它能够在多大程度上学习新的推理能力仍然存在争议。在这里,我们研究 RLVR 在算法任务上的优化前景,例如迭代群和拟群乘法。为此,我们将近视表格策略上的熵正则化 RLVR 映射到确定性策略上的基于能量的(自旋玻璃)模型。这种映射限制了 RLVR 可以实现的目标,并让我们能够严格描述此表格设置中的景观。我们从理论上和实验上证明,对于具有不相关输入的各种模型和任务来说,这种情况是良性的,不包含可能陷入 RLVR 训练的局部最小值。相反,这些任务的实际难度似乎至少部分源于诸如穿越景观时的扩散障碍和梯度估计误差等问题。这些都是真正的障碍,可能会阻碍找到解决方案,但它们与地形本身的崎岖不同。我们表明,这些障碍通常可以通过选择熵调节器来减轻。与这个理论一致,我们发现从头开始训练的Transformer,仅使用最后一个词元奖励,成功地学习了迭代非阿贝尔群乘法的算法思想链。