论文
深度上限:论大语言模型在发现潜在规划方面的极限
The Depth Ceiling: On the Limits of Large Language Models in Discovering Latent Planning
摘要
思想链(CoT)监控的可行性取决于模型无法在其潜在表示中进行有效推理。然而,人们对 LLM 中这种潜在推理的局限性知之甚少。我们通过研究模型是否可以在没有中间步骤监督的情况下发现多步骤规划策略并在单个前向传递中潜在地执行它们来测试这些限制。使用精确控制所需潜在规划步骤数量的图形路径查找任务,我们发现了大规模扩展无法解决的显着限制:从头开始训练的微小 Transformer 发现需要最多三个潜在步骤的策略,微调后的 GPT-4o 和 Qwen3-32B 达到五个,而 GPT-5.4 在几次提示下达到七个。尽管模型在训练期间可以学习的最大潜在规划深度为 5,但所发现的策略在测试时最多可推广 8 个潜在步骤。这揭示了仅在最终答案监督下发现潜在策略的能力与发现后执行该策略的能力之间的脱节。如果类似的限制更广泛地存在,则可能需要明确地教授或具体化需要多个协调的潜在规划步骤的策略,从而为 CoT 监控提供可信度。