论文
VERIFY-RL:面向数学推理强化学习的可验证递归分解
VERIFY-RL: Verifiable Recursive Decomposition for Reinforcement Learning in Mathematical Reasoning
摘要
训练语言模型解决复杂数学问题可从课程学习中获益,即在更简单的子问题上逐步训练。然而,现有分解方法通常是启发式的,无法保证子问题更简单、求解它们有助于父任务,或它们之间的关系在数学上有依据。我们观察到,符号微分提供了一种用于可验证分解的自然结构:微积分法则明确规定了表达式如何按可证明的性质化归为更简单的组成部分。我们提出Verify-RL,一个其中每个父子分解都满足三个可验证条件的框架:结构复杂度严格递减、解包含以及形式化法则推导。与大量分解无效的启发式方法不同,我们的性质可通过符号计算自动验证,实现“构造即验证”。实验表明,消除无效分解带来可观收益:最难问题的准确率从32%翻倍以上达到68%,总体相对提升40%。
