论文
构建逆向思维:培养大语言模型的逆向思维能力
Construting Reverse Thinking: Developing Large Language Models' Reverse Thingking Ability
摘要
面对复杂问题时,人类会针对不同情形尝试各种想法,其思维模式在适应多样场景时展现出显著灵活性。GPT-o1、GPT-o3 与 DeepSeek-R1 采用长思维链模式,通过加深推理深度来解决复杂问题,但其默认采用正向推理模式。我们对不同规模的模型在多个数学问题数据集上的准确率进行统计分析,发现错误有五种原因:解空间覆盖不足、计算失误、假设未经检验、忽略约束条件、最大响应长度限制。针对上述问题,我们提出一种逆向推理模式构造方法,旨在增强模型的逆向思维能力与动态适应能力。首先,我们构建了一个由易到难的两阶段数学数据集用于训练大模型,逐步提升其在不同难度层级上的推理能力;该数据集同时包含正向推理路径与逆向推理路径。随后应用两阶段监督微调流程,渐进式地训练模型的逆向推理能力。此外,我们设计了细粒度奖励机制,利用平滑的奖励信号强化模型在推理过程中自主选择思维模式的能力,从而避免奖励劫持;还设计了线性衰减的均衡采样策略,在训练期间保持正向与逆向推理路径样本的平衡,使模型快速而稳定地收敛。实验结果表明,我们的方法在数学证明等任务上显著提升推理效率与准确率,为解决复杂问题提供了一种灵活高效的推理范式。
