论文

RAGEN-2:智能强化学习中的推理崩溃

RAGEN-2: Reasoning Collapse in Agentic RL

模型训练强化学习

摘要

多轮 LLM 智能体的强化学习训练本质上是不稳定的,推理质量直接决定任务性能。熵被广泛用于跟踪推理稳定性。然而,熵只能衡量同一输入内的多样性,并不能判断推理是否真正对不同的输入做出反应。在 RAGEN-2 中,我们发现即使熵稳定,模型也可以依赖看起来多样化但与输入无关的固定模板。我们称这种模板崩溃为熵和所有现有指标不可见的故障模式。为了诊断这种失败,我们将推理质量分解为输入内多样性(熵)和交叉输入可区分性(互信息,MI),并引入一系列互信息代理用于在线诊断。在不同的任务中,互信息与最终性能的相关性比熵更强,使其成为推理质量更可靠的代理。我们用信噪比(SNR)机制进一步解释模板崩溃。低奖励方差削弱了任务梯度,让正则化项占据主导地位并消除了交叉输入推理差异。为了解决这个问题,我们提出 SNR 感知过滤,使用奖励方差作为轻量级代理来选择每次迭代的高信号提示。在规划、数学推理、网络导航和代码执行方面,该方法不断提高输入依赖性和任务性能。