论文
INSPIRE:一种内化然后改进的示例驱动数学推理方法
INSPIRE: An Internalize-Then-Improve Approach for Example-Driven Mathematical Reasoning
摘要
数学推理在 大语言模型 (LLM) 中取得了快速进展,但现有方法主要针对最终答案的正确性进行优化,这就提出了模型是否真正内化数学概念还是仅仅记住解决方案模式的问题。在人类数学教育中,基于实例的推理(例如构建反例来测试定理边界)反映了深刻的概念理解,但在当前的 LLM 中仍然不发达。通过偏好优化来增强这种能力存在两个关键挑战:(1)模型基于示例的推理能力有限,使得构建有效的偏好对本身就很困难; (2)能力获取是渐进的,因为模型必须首先学会采用这种策略,然后才能学会正确应用它。因此,我们提出了INSPIRE,一种内部化然后改进的方法,结合了参考引导学生内部化(RGSI),它在政策模型自身的分布下产生高质量的偏好候选,与阶段性的标题偏好训练策略相结合,将学习分解为以方法为导向和以正确性为导向的阶段。跨多个模型规模和系列的实验证明了持续的改进,甚至超越了更大的开源模型,而对分布外基准的评估证实了一般数学推理能力没有下降。