论文
多样思维图式引出大语言模型更好的推理
Diverse Thinking Schemata Elicit Better Reasoning in Large Language Models
摘要
大型推理模型(LRM)因其通过生成扩展推理链来解决复杂数学问题的能力而受到越来越多的关注。在这项工作中,我们重点关注推理过程的两个关键但尚未充分探索的方面:推理转换捕获推理步骤和候选答案之间的不同转换,反映模型生成的各种解决方案路径。我们将这两个方面统称为思维图式。我们观察到思维图式的多样性和模型性能之间的相关性,这激励我们增强多样性作为进一步提高推理潜力的手段。为此,我们提出了多样化图式策略优化(DiScO),该框架首先赋予模型图式意识,然后通过强化学习鼓励多样性,并进一步促进推理时的多样化推理。多个数学推理基准的实验表明,DiScO 始终优于标准组相对策略优化。除了准确性之外,人工注释的分析表明 DiScO 大大提高了模型从错误的初始尝试中恢复的能力。总的来说,我们的工作表明了思维模式的多样性所发挥的重要作用,并指出沿着多样性维度进行扩展是一个有前途的研究方向。
