论文

穿过瓶颈思考:面向严格归纳的沙漏推理

Think Through a Bottleneck: Hourglass Reasoning for Rigorous Induction

模型推理上下文与知识推理策略与问题分解上下文工程

摘要

自精炼常未能强化大语言模型的少样本归纳推理。让模型显式陈述其推断规则本身收效甚微。真正重要的是在推理阶段之间强制结构化隔离,使信息只能以压缩的符号状态在阶段间通过。我们引入沙漏推理:在推理阶段之间强制严格的上下文隔离。冻结的LLM充当元构造器,为每个任务构建符号编码器—解码器:归纳模块把支持样例压缩为模式φ(编码器)与瞬态脚手架z;演绎模块从这些推导规则T(解码器)并丢弃z;实现者把(φ, T)编译为工件;错误驱动的精炼器修订(φ, T)并从零再生成工件。只有(φ, T)跨越阶段边界,所有精炼保持锚定在规则上。我们在三个基准上评估沙漏——横跨视觉抽象、硬件综合与文本规则归纳——使用GPT-5.5与Gemini 3.1 Pro。在ARC-AGI-2上:较迭代精炼基线把best-of-5准确率提升最多14分;在ChipBench上:GPT-5.5把Verilog综合准确率从31%几乎翻倍到58%;BBEH-Linguini取材国际语言学奥赛谜题——既往工作显示显式言语化在该设定会损害表现,沙漏缓解该倾向,且在Gemini 3.1 Pro上完全逆转。消融确认增益来自阶段间隔离与初始归纳质量,而非提示措辞或所用符号形式。决定冻结LLM归纳推理的,是信息如何流经推理过程,而非表达它的语言。