迈向技能原生 LLM:用于基准测试和训练长视野推理的技能熵
Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning
摘要
最近的 LLM 中的长视野推理要求模型在推理链内的不同技能之间切换,例如首先进行数学推导,然后使用结果来规划时间表。我们将此类问题称为跨技能长期任务:多步骤任务,其步骤需要不同的推理技能并依赖于早期的输出。现有的基准通常评估个人技能,缺乏原则性的方法来衡量模型在技能之间切换的效果。我们从评估和训练两个方面解决这一差距。我们引入技能熵,衡量从一种技能切换到另一种技能的难度。然后,我们提出了 Skill^2-Bench,这是跨技能长期任务的基准,构建了跨 9 个可验证和开放式领域的 558 项技能。每个任务都分配有一个任务级别的技能熵分数,并分为三个难度级别。在 Skill^2-Bench 上评估 8 个前沿模型和 4 个开源模型揭示了技能切换差距:高熵任务的准确性会降低。然后,我们将技能熵从基准尺度转化为训练信号。我们提出了 Skill-Entropy RL,这是一种 RL 框架,其中模型不仅可以预测每个步骤的答案,还可以预测用于生成答案的技能。该奖励将步骤级正确性与技能熵奖励相结合,技能熵奖励衡量模型预测的技能序列与标准技能序列之间的一致性。在 Qwen3-4B-Instruct 和 Qwen3-1.7B 上,Skill-Entropy RL 将 Skill^2-Bench 分数分别从 34.4% 提高到 68.4% 和从 14.6% 提高到 40.1%,优于竞争基线。相同的流程可以应用于现成的训练数据,例如 OpenR1-Math,这表明技能熵是可重用的训练信号。代码位于:https://github.com/Gen-Verse/Skill-Entropy-RL