论文

思想的差异:策略方差、关键分叉和本地信用分配

The Variance of Thought: Policy Variance, Critical Forks, and Local Credit Assignment

模型训练强化学习

摘要

长期语言模型任务——多步骤推理和工具使用代理等——受到学分分配的限制。我们通过策略方差 $σ_π^2(s)=\operatorname{Var}_{a\simπ}[Q_π(s,a)]$ 进行分析,它在确定性 MDP 中是返回方差的唯一来源,并在我们称为关键分叉的状态下注入离散脉冲。以下是三个结果。 (i) 政策方差是一个发现预算:观察优势行动 $c$ 需要 $Ω(c^2/σ_π^2(s))$ 绘制,这是在规范两点分叉上精确的界限。 (ii) 政策方差受政策的基尼离散度 $σ_π^2(s)\le 1-\|π(\cdot|s)\|_2^2$ 限制,这是可单独从 logits 计算的关键性的免采样轨迹必要条件。 (iii) 剩余范围设定估计成本:在下游成功概率为 $P$ 的分叉处,蒙特卡洛优势估计的信噪比为 $\sqrt{P}$,因此其样本成本为 $1/P$——分支采样共享的成本。引导通过将生存概率的乘积转换为总和来消除它,前提是值表示是乘法准确的,这支持对数值参数化。