论文
不动点推理器:稳定自适应的深循环Transformer
Fixed-Point Reasoners: Stable and Adaptive Deep Looped Transformers
摘要
循环架构为需要组合推理的任务提供了学习逐步程序的归纳偏置。循环达到的有效层数决定这些模型找到的解的质量。与深架构一样——循环架构在停止决策被推迟时易受深度引起的信号传播问题影响。本文中——我们以预归一层与残差缩放解决该信号传播问题。基于这些架构修改——我们提出FPRM——基于Transformer的不动点推理模型——在循环架构中以不动点收敛作为端到端停止机制。我们表明不动点停止使FPRM能把计算适配到任务难度。FPRM在常见推理基准上有效——即数独、迷宫、状态追踪与ARC-AGI。
