论文
Penelope:面向高效结构化推理的局部化潜空间循环
Penelope: Localized Latent Recurrence for Efficient Structured Reasoning
摘要
复杂的结构化推理任务常常需要额外计算,而当前语言模型主要通过增大参数规模或将中间步骤序列化为思维链(CoT)token来获得这种计算。前者推高训练与部署成本,后者则将推理计算与自回归输出长度绑定。我们提出Penelope,一个面向预训练decoder-only Transformer的高效潜空间推理框架,它将循环计算局部化到选定的decoder区间。较低的decoder前缀只计算一次以构建问题条件化的边界记忆,该记忆随后在答案生成之前通过时间调制的GRU动态与循环读出状态被迭代精炼。一个渐进的CoT到潜空间课程将可见推理迁移到这一内部循环路径,使额外计算得以在潜空间中分配,而无需反复执行完整decoder或生成长中间轨迹。在开源结构化推理基准上的实验表明,在由验证集选定的潜空间预算下,Penelope相对已有的潜空间推理模型取得有竞争力的准确率,同时降低了实测推理延迟。这些结果表明,潜空间精炼可以局部化到狭窄的decoder区间,在不生成长可见推理轨迹的情况下减少对完整decoder的重复执行,并为decoder-only Transformer模型提供实用的精度-效率权衡。