论文

LLM问题求解中的泛化:以最短路径为例

Generalization in LLM Problem Solving: The Case of the Shortest Path

模型评测模型能力评测

摘要

语言模型能否实现系统性泛化仍存在激烈争论。然而,实证表现由训练数据、训练范式与推理时策略等多重因素共同塑造,使得失败难以解读。我们引入一个基于最短路径规划的受控合成环境——最短路径规划是一个典型的可组合序列优化问题。该设置能够干净地分离这些因素,并支持两个正交的泛化轴:向未见地图的空间迁移,以及向更长时程问题的长度扩展。我们发现,模型展现出很强的空间迁移能力,却因递归不稳定性在长度扩展下持续失败。我们进一步分析学习流水线的各个阶段如何影响系统性问题求解:例如,数据覆盖设定了能力上限;强化学习改善了训练稳定性,但并未扩展这些上限;推理时扩展能提升性能,却无法挽救长度扩展失败。

LLM问题求解中的泛化:以最短路径为例:论文配图
图 1:模型成功转移到训练长度内未见过的测试地图,但无法推广到更长的路径。垂直虚线表示训练和更长长度之间的边界。表1:长度缩放失败的成分分析。全路径成功率 Pr⁡(Long)\Pr(\text{Long}) 可以分解为 Pr⁡(Long,Sub1∧Sub2)\Pr(\text{Long},\,\text{Sub}_{1}\land\text{Sub}_{2}) 和Pr⁡(Long,Ø(Sub1∧Sub2))\Pr(\text{Long},\,\neg(\text{Sub}_{1}\land\text{Sub}_{2}))。退化主要是由 Pr⁡(Long∣Sub1∧Sub2)\Pr(\text{Long}\mid\text{Sub}_{1}\land\text{Sub}_{2}) 的下降引起的,表明在递归应用学习规则的情况下稳定性降低。