论文
LLM问题求解中的泛化:以最短路径为例
Generalization in LLM Problem Solving: The Case of the Shortest Path
摘要
语言模型能否实现系统性泛化仍存在激烈争论。然而,实证表现由训练数据、训练范式与推理时策略等多重因素共同塑造,使得失败难以解读。我们引入一个基于最短路径规划的受控合成环境——最短路径规划是一个典型的可组合序列优化问题。该设置能够干净地分离这些因素,并支持两个正交的泛化轴:向未见地图的空间迁移,以及向更长时程问题的长度扩展。我们发现,模型展现出很强的空间迁移能力,却因递归不稳定性在长度扩展下持续失败。我们进一步分析学习流水线的各个阶段如何影响系统性问题求解:例如,数据覆盖设定了能力上限;强化学习改善了训练稳定性,但并未扩展这些上限;推理时扩展能提升性能,却无法挽救长度扩展失败。
