论文

论思想链的成本与收益:学习理论的视角

On the Cost and Benefit of Chain of Thought: A Learning-Theoretic Perspective

模型推理推理策略与问题分解

摘要

我们开发了一个学习理论框架来理解思想链(CoT)。我们将 CoT 建模为答案图和自回归生成中间问题的链式规则之间的交互,并定义这种交互下假设的推理风险。我们的第一个结果是将该风险严格规范地分解为具有相反作用的两个术语:预言轨迹风险(OTR),它捕获了 CoT 的好处并在域适应问题中减少为目标域风险;轨迹不匹配风险(TMR),它通过沿着不匹配的推理轨迹累积错误来捕获 CoT 的成本。然后我们证明,如果没有结构,这种成本是不可避免的:如果损失、假设答案图或链式法则中的任何一个缺乏稳定性,即使 OTR 为零且假设一致接近 真值,TMR 也可以任意大。相反,在稳定性条件下,我们证明了 TMR 的严格上限,该上限由精确的放大因子控制,该放大因子识别有界、线性和指数误差增长状态。总之,这些结果给出了关于 CoT 何时有帮助、何时有害以及控制两者之间过渡的精确理论。