论文

HISPO:基于熵分段的层级重要性采样策略优化

HISPO: Hierarchical Importance-Sampling Policy Optimization with Entropy-Derived Segments

模型训练强化学习RLVR

摘要

可验证奖励强化学习RLVR已成为改善数学推理的重要方法,但长回答带来信用分配困难:轨迹不同部分对最终正确性的贡献不均。现有目标通常在token级如GRPO、DAPO,或序列级如GSPO进行重要性采样校正。我们提出HISPO,在轨迹生成时根据熵构造连续片段,赋予基于熵的软显著性权重,并在片段粒度应用裁剪重要性采样,提供介于token与整序列之间的校正单位。我们通过在数学任务上微调Qwen3-1.7B-Base评估。在六个基准中,HISPO的Pass@8全部优于最强基线,Acc@8在五个达到或超过最强基线。在AIME25上,相比GRPO,Acc@8提高3.75、Pass@8提高3.78;相比GSPO分别提高2.50和1.27。结果提示片段级校正是长数学推理RLVR有前景的粒度。