论文
SAGE:通过拓扑引导缓解长程推理偏差
SAGE: Mitigating Long-Horizon Reasoning Biases via Topological Guidance
摘要
在稀疏奖励机制下,长程推理仍是大语言模型(LLM)面临的核心挑战。我们认为这种脆弱性源于复杂推理空间诱导的两种偏差:一是探索偏差,模型被局部看似合理但结构上不稳定的分支吸引;二是累积偏差,微小的局部偏差随深度不断累积,压制了稀少的奖励信号。我们提出符号闭包分析(Symbolic Closure Analysis, SCA),既作为理论透镜刻画具有局部可采纳性的长程推理中分支结构与稀疏奖励如何诱导上述偏差,也作为在较不形式化推理任务中引入结构先验的设计原则。基于该分析,我们提出SAGE(Structural Admissibility-Guided Exploration),一个通过注入结构引导来缓解长程推理中探索偏差与累积偏差的统一框架。SAGE结合两种互补的结构引导:代数稀疏化——将局部可采纳的候选投影到以算子为索引的代数子空间,以抑制虚假分支并缓解探索偏差;以及双曲结构引导——将推理状态嵌入负曲率空间,以提供稠密的深度方向信号并缓解累积偏差。在12个基准和7个模型家族上,SAGE优于各类竞争基线。特别是,SAGE在Andrews-Curtis问题——一个开放的真实长程任务——上取得最高8倍的提升。代码已开源。
