论文

流推理模型:将流转化为高效的循环推理器

Flow Reasoning Models: Turning Flows Into Efficient Recurrent Reasoners

模型架构新型架构

摘要

结构化推理需要制定和修改相互依赖的决策,以达到全局一致的解决方案。现有的架构正在努力解决这个问题:自回归模型按顺序提交并且无法修改早期决策,而掩码扩散模型通常需要仔细的解码方案来协调相互依赖的预测。我们引入了流推理模型(FRM),这是一种新颖的结构化推理框架,它通过简单的循环细化机制适应离散结构化输出上的连续流。通过根据其过去的输出对流模型进行自调节,我们将一次性去噪转变为迭代解决方案细化。这使得 FRM 能够并行制定和修改决策,有效协调跨解决方案的相互依赖的选择。然而,由于一步训练预测和递归生成的推理状态之间的暴露偏差,传统的自调节在更大的循环深度下变得不可靠。我们通过定点强制 (FPF) 解决了这种不匹配问题,该方法在 FRM 自身推理动态产生的状态上训练 FRM,同时保留标准流匹配目标。 FRM 在 Sudoku-Extreme、Zebra 和 Maze-Unique 上的解决率分别为 $99.5\%$、$100.0\%$ 和 $99.9\%$。在 Sudoku-Extreme 上,FRM 实现了比评估的掩蔽扩散和专门推理基线更高的峰值精度,同时保持高计算效率,与次佳方法的 $98.7\%$ 峰值求解率相匹配,推理失败次数减少了 $44\times$。