论文
放弃行动:探索过滤强化学习以实现忠实的思想链推理
Drop the Act: Probe-Filtered RL for Faithful Chain-of-Thought Reasoning
摘要
推理模型事后合理化他们已经在内部承诺的答案,产生“推理剧场”链:看似深思熟虑的步骤,对正确性没有任何贡献。这浪费了推理标记,污染了可解释性,并且模糊了模型实际计算的内容。我们引入 **ProFIL**(**Pro**be-**Filtered Reinforcement Learning)来*减少戏剧性,增加思想链 忠实性,并在单个、直接扩展到组相对策略优化 (GRPO) 中缩短链长度*。多头注意力探针在“冻结”基础模型上训练“一次”,以仅从内部激活中检测承诺后步骤;在 GRPO 期间,探测分数超过阈值的采样轨迹其优势为零。 *我们的主要发现是,在冻结基础上训练的探针,具有验证者衍生的标签,没有人工注释,可提供稳定的信号,抑制戏剧性,同时抵抗先前工作预测的 RL 混淆故障模式。* 在四个推理领域(GSM8K、LiveCodeBench、ToolUse、MMLU-Redux)和两种模型架构(Llama-8B、Qwen-7B)中,ProFIL 将承诺后戏剧性减少了**11--100%**,提高忠实分数(例如,在独立的 Claude 3.7 Sonnet 评判下,LiveCodeBench 上 +24pp),并将链条缩短 4--19%,同时保持或提高任务准确性。 ProFIL 还击败了匹配的长度惩罚 GRPO 基线,将增益隔离为语义承诺检测而不是链压缩。探针权重、训练配置和部署在所有四个领域中发布。