论文

更短的想法,相同的答案:CoT 压缩的难度扩展分段强化学习

Shorter Thoughts, Same Answers: Difficulty-Scaled Segment-Wise RL for CoT Compression

模型训练强化学习RLVR

摘要

思想链(CoT)提高了推理可靠性,但增加了token成本,从而促进了显式推理轨迹的训练后压缩。然而,最短的充分推理并不通用:它取决于难度、模型容量和训练状态,使得固定长度的目标变得脆弱。在实践中,基于强化学习的简单压缩也会不必要地缩短面向用户的答案,因为单个完成级别的学习信号会跨越思考/答案边界泄漏。我们提出了按难度缩放的分段 GRPO (DSS-GRPO),它将回报分解为思考和答案组件,计算每个分段的组相对优势,并使用硬token掩码路由它们,以便压缩更新仅作用于思考,而答案对齐仅作用于答案。 DSS-GRPO 使用及时的组内塑造和难度感知缩放来鼓励简洁的推理,而不会破坏答案行为。

SCA:带答案对齐的分段思维链压缩
图2:GSM8K示例:Base 与 DSS-GRPO 的比较。