论文

问对问题:用生成的垫脚石改进推理

Asking the Right Questions: Improving Reasoning with Generated Stepping Stones

模型推理推理策略与问题分解

摘要

近年来,大语言模型在解决数学和编码等复杂推理任务方面取得了巨大进展。当我们开始将大语言模型应用于他们可能无法一次性解决的更困难的任务时,值得关注他们构建中间垫脚石的能力,以帮助他们更好地解决任务。踏脚石的例子包括简化、替代框架或子问题。我们通过 ARQ(\textbf{A}king the \textbf{R}ight \textbf{Q}questions)研究现代推理 LLM 背景下垫脚石的属性和好处,这是我们的简单框架,它将问题生成器引入到默认推理管道中。我们首先证明好的垫脚石问题是存在的并且是可转移的,这意味着好的问题是可以产生的,并且它们可以极大地帮助具有各种能力的大语言模型解决目标任务。接下来,我们将垫脚石生成作为训练后任务,并表明我们可以微调 LLM,通过 SFT 和 RL 对合成数据生成更有用的垫脚石。

问对问题:用生成的垫脚石改进推理
图1:ARQ示意。不再直接求解对给定求解器而言可能过难的任务(上),ARQ(下)增加一个提问步骤,促使或训练LLM生成垫脚石问题(stepping stone questions),这些问题一旦被解决,便为原问题提供指引或启发。用于生成垫脚石问题的LLM被称为垫脚石生成器(stepping stone generators)。在此例中,垫脚石(由LLM生成)聚焦于原问题的一个特例。