论文
通过误差放大量化多步推理的稳定性
Quantifying the Stability of Multi-Step Reasoning via Error Amplification
摘要
我们考虑多步推理过程的稳定性,该过程在语言模型中具有广泛的应用,包括思维链和算法推理。虽然较长的推理序列可以提高模型在测试时的生成能力,但中间推理步骤引起的错误可能会在自回归生成中累积,从而在最终大幅增长。在本文中,我们要问:决定多步推理稳定性的关键因素是什么?首先,我们展示了由跨生成步骤的输入空间获取的雅可比行列式谱范数的乘积控制的推理误差界限。该乘积可以被视为误差放大因子,它可以随着推理步骤的数量呈指数级增长,作为推理稳定性的定量度量。其次,我们在经过训练来预测线性和二次函数等简单任务的变压器模型中分析了这一测量。我们从理论上证明,变压器模型收敛到稳定性度量衰减的解决方案,从而在(任意)长步长上产生几乎为零的推理损失。最后,稳定性分析通过 (i) 思维链长度压缩降低每个步骤的灵敏度,以及 (ii) 量化感知训练规范输入雅可比矩阵范数,从而得出控制稳定性的几种算法含义。我们通过微调语言模型在图算法推理任务和符号状态跟踪任务上验证了所提出的算法。在七次评估中,我们的算法比基线比较平均提高了 3.5%,对于较长的输入提高了 8.2%。 消融分析验证了稳定性度量大幅降低了 3-8$\times$,证实了对(输入空间)雅可比行列式谱范数的正则化效果。