论文

学生引导教师:基于谱正交探索的弱到强推理

Student Guides Teacher: Weak-to-Strong Inference via Spectral Orthogonal Exploration

模型推理推理搜索与路径规划

摘要

虽然大语言模型 (LLM) 表现出接近人类的能力,但它们在复杂的数学证明和长期规划中经常遭受“推理崩溃”的困扰。模型往往会退化为低阶偏差流形,其中随机采样仅产生错误逻辑的词汇变化,而不是语义探索。这种几何崩溃使模型对其零空间内的高价值解决方案“视而不见”。为了解决这个问题,我们提出了谱正交探索(SOE),这是一种在反直觉的“学生引导教师”范式上运行的几何框架。具体来说,我们使用弱辅助剂不是为了模仿,而是作为正交探针。通过明确地导航教师的零空间,SOE 充当几何桥梁,有效地将模型从局部最优中弹出,以探索多样化的高价值解决方案空间。数学基准实验表明,相对于基线方法,我们的方法将平均准确度提高了 62.4%,将平均采样效率提高了 113.7%,这表明了克服高级推理任务中性能瓶颈的一条有希望的道路。

学生引导教师:基于谱正交探索的弱到强推理 配图
图 4:SOE 框架