论文
问对问题:用生成的垫脚石改进推理
Asking the Right Questions: Improving Reasoning with Generated Stepping Stones
摘要
近年来,大语言模型在解决数学和编码等复杂推理任务方面取得了巨大进展。当我们开始将大语言模型应用于他们可能无法一次性解决的更困难的任务时,值得关注他们构建中间垫脚石的能力,以帮助他们更好地解决任务。踏脚石的例子包括简化、替代框架或子问题。我们通过 ARQ(\textbf{A}king the \textbf{R}ight \textbf{Q}questions)研究现代推理 LLM 背景下垫脚石的属性和好处,这是我们的简单框架,它将问题生成器引入到默认推理管道中。我们首先证明好的垫脚石问题是存在的并且是可转移的,这意味着好的问题是可以产生的,并且它们可以极大地帮助具有各种能力的大语言模型解决目标任务。接下来,我们将垫脚石生成作为训练后任务,并表明我们可以微调 LLM,通过 SFT 和 RL 对合成数据生成更有用的垫脚石。
