论文
大语言模型能够再发明基础算法吗?
Can Large Language Models Reinvent Foundational Algorithms?
摘要
大语言模型(LLM)已展现出推动科学发现的强大潜力。然而,它们是否具备基础性创新能力仍是一个开放问题。在这项工作中,我们聚焦于基础性创新的一个前提:LLM能否再发明计算机科学中的基础算法?我们的Unlearn-and-Reinvent流水线对LLM施加遗忘,以从其预训练知识中移除特定基础算法(如Dijkstra算法或Euclid算法),然后在受控环境中测试模型能否再发明它。为实现有效遗忘,我们采用基于GRPO的同策略(on-policy)遗忘方法。在10个目标算法、3个强开源权重模型和3个提示等级上的实验表明:(1) 最强的模型Qwen3-4B-Thinking-2507在无提示下成功再发明50%的算法,提示等级1下达70%,提示等级2下达90%;(2) 少量高层提示能提高再发明成功率,但对那些复杂算法,即使逐步提示也无法成功;(3) 测试时强化学习使Strassen算法在提示等级2下得以成功再发明。通过对输出轨迹的分析和消融研究,我们发现再发明阶段中的生成式验证器对维持模型推理强度起着关键作用,有助于避免『思维坍缩』现象。这些发现为LLM创新思维的潜力与当前局限提供了洞见。