论文

通过可驾驭的轨迹控制学习结构化推理

Learning Structured Reasoning via Tractable Trajectory Control

模型训练强化学习

摘要

大语言模型能表现出涌现的推理行为,常表现为反复出现的词汇模式(如表示核查的“wait”)。然而,复杂推理轨迹在无约束采样中依然稀少,标准 RL 常无法保证习得多样的推理行为。我们提出通过结构化推理系统性地发现并强化多样推理模式,这一范式要求在 RL 过程中对特定推理模式进行定向探索。为此,我们提出 Ctrl-R,一个通过可驾驭轨迹控制学习结构化推理的框架,主动引导 rollout 过程,激励探索对复杂问题求解关键的多样推理模式。所得行为策略支持准确的重要性采样估计,实现无偏的 on-policy 优化。我们进一步在重要性采样权重上引入幂缩放因子,使策略能有选择地从探索性的分布外轨迹中学习,同时保持优化稳定。实验表明 Ctrl-R 能有效探索并内化此前无法获得的推理模式,在语言与视觉语言模型的数学推理任务上带来一致改进。

通过可驾驭的轨迹控制学习结构化推理
图5:早期训练效率比较:图中比较了我们的Medium Control方法(红色)与Baseline及其他控制设置随时间变化的奖励/准确率。我们的方法在前150步中表现出高出+14.0%的AUC(高亮显示为”Early Efficiency Zone”),表明在初始探索阶段收敛显著更快。