论文

超越熵:从token级分布偏离中学习LLM推理

Beyond Entropy: Learning from Token-Level Distributional Deviations for LLM Reasoning

模型训练强化学习RLVR

摘要

可验证奖励强化学习(RLVR)显著推进大语言模型(LLM)推理——但它面临根本性的优化不稳定:统一的token更新促成熵坍缩——导致过早收敛到次优策略——而过度的香农熵最大化会造成熵爆炸——驱使盲目探索走向不连贯推理链。为解决这一二分——我们引入独立组合token(ICT)框架——把优化焦点从标量不确定性转向token logits的分布性质。利用token logits分布间的Jensen-Shannon(JS)散度——ICT把具有独特分布模式的token识别为关键分支点——引导LLM推理的有效探索。我们的理论分析(基于香农与二阶Rényi熵)证明:在这些token上选择性更新调节策略集中度——降低香农熵度量的整体分布不确定性——同时控制二阶Rényi熵捕捉的概率集中。这种双重效应防止过度集中的token生成削弱探索——有效稳定训练地貌。实证结果表明:在Qwen2.5(0.5B/1.5B/7B)模型上只更新最独特的10% token——较GRPO、20-Entropy与STAPO基线在横跨数学、常识与奥赛级问题的七个基准上平均pass@4提升4.58%——最大增益14.9%。

超越熵:从token级分布偏离中学习LLM推理:论文配图
图 1:(a) 盲目探索(香农熵):不同的概率分布可以产生相同的香农熵,从而使信号变得模糊。这会导致盲目探索,常常导致死胡同和持续的不确定性(橙色曲线)。 (b) 引导探索(分布式信息):ICT 框架通过分布式特性确定有希望的路径之间的关键分支点。这使得引导探索成为可能,实现稳定的收敛(红色曲线),同时避免香农熵不稳定和统一令牌更新带来的熵崩溃(蓝色曲线)。