论文
在信念改变前分叉:树结构强化学习的分支位置选择
Fork Where the Model Changes Its Mind: Belief-Shift Branching for Tree-Structured Reinforcement Learning
摘要
树结构采样轨迹为无评论器的可验证奖励强化学习提供步骤级归因:在中间位置分叉,由兄弟分支结果差异估计步骤价值。每次分叉都增加采样成本,现实预算通常只允许少量分叉;若结果已经基本确定,兄弟分支一致,几乎没有归因信号。因此固定树规模下,分叉位置决定收益。既有方法通常按固定长度、中点、分隔符或下一Token熵选位置。我们将其表述为寻找链价值曲线上预期结果转折的枢轴,提出信念变化分叉:读取候选边界处模型的答案信念,在连续信念差异最大的步骤之前分叉。无需步骤监督的三种实现覆盖黑盒探针、logit lens深度剖面及学习的激活方向;后者离线拟合,仅用于强化学习前验证。该信号只决定分叉位置,在采样引擎内运行时,数学探针约占步骤计算1%,代码低于5%。对照蒙特卡洛价值曲线,信念变化信号在八个模型×基准面板均优于熵、结构和LLM评审基线。在三类模型、两个领域强化学习中,数学汇总指标全部领先,OLMo-3-7B比最强基线的汇总指标高2.6、AIME 2026高2.9;OLMo代码各列也全部领先,LiveCodeBench-medium高6.5。