论文

寻找RELIEF:经信念工程在无推理监督下塑造推理行为

Finding RELIEF: Shaping Reasoning Behavior without Reasoning Supervision via Belief Engineering

模型训练监督微调与指令调优

摘要

大型推理模型(LRM)在复杂问题求解上成就卓著,但常受计算冗余或推理不忠实之苦。当前塑造 LRM 行为的方法通常依赖强化学习或用标准推理轨迹微调,这一范式计算昂贵且难以扩展。本文揭示 LRM 拥有潜在的推理信念(reasoning beliefs),在内部追踪自身的推理特质,并可通过简单的 logit 探测捕获。基于这一洞见,我们提出 Reasoning Belief Engineering(RELIEF),一个通过让模型自我概念与目标信念蓝图对齐来塑造 LRM 行为的简单而有效的框架。关键在于,RELIEF 完全无需推理轨迹监督。它通过在合成的、肯定目标信念的自反式问答对上微调来内化期望特质。在效率与忠实性任务上的大量实验表明,RELIEF 以更低的训练成本匹配或优于行为监督与偏好基线。进一步分析验证,改变模型的推理信念能有效塑造其实际行为。

寻找RELIEF:经信念工程在无推理监督下塑造推理行为
图2:所提出的用于塑造 LRM 推理行为的 RELIEF 框架概览。