论文
何时重新规划:分层潜空间推理中的子目标持久性
When to Re-Plan: Subgoal Persistence in Hierarchical Latent Reasoning
摘要
长期推理要求系统致力于中期意图而不变得僵化:重新计划过于频繁,计算永远不会凝聚成多步骤结构;承诺时间太长,计划就会变得陈旧。我们在潜在推理设置中研究这种稳定性与适应性的权衡,其中多步计算发生在隐藏状态而不是外部化的令牌跟踪内。我们用封建风格的管理者-工作人员界面扩展了层次推理模型(HRM):一个缓慢的高级模块定期发出一个标准化的方向子目标,该子目标持续存在 P 个低级步骤,使工作人员的隐藏状态更新产生偏差并提供内在的余弦对齐损失。在 ARC 和 ConceptARC 上,我们发现子目标持久性(而不是单独的子目标注入)是中心旋钮:[3, 6] 中的中等周期 P 始终优于非常频繁 (P=1) 和非常长的视野,在 P=3 处具有明显的最小 LM 损失(P=1、1.640 基线时为 1.544 对比 1.674;以平均值 1.595、std 复制超过 5 个种子0.045)。内在对齐权重 lambda 显示了互补的窄最优值(lambda 约为 0.05)。当对准信号超过其最佳值时,过去最佳点 lambda 处的受控消融将学习的方向结构(而不是单独的架构能力或辅助损耗)隔离为干扰源。这些发现共同暗示了潜在推理系统中组合规划的设计原则:中期意图必须在足够的计算步骤中保持一致,以形成组合结构。