论文
通过可驾驭的轨迹控制学习结构化推理
Learning Structured Reasoning via Tractable Trajectory Control
摘要
大语言模型能表现出涌现的推理行为,常表现为反复出现的词汇模式(如表示核查的“wait”)。然而,复杂推理轨迹在无约束采样中依然稀少,标准 RL 常无法保证习得多样的推理行为。我们提出通过结构化推理系统性地发现并强化多样推理模式,这一范式要求在 RL 过程中对特定推理模式进行定向探索。为此,我们提出 Ctrl-R,一个通过可驾驭轨迹控制学习结构化推理的框架,主动引导 rollout 过程,激励探索对复杂问题求解关键的多样推理模式。所得行为策略支持准确的重要性采样估计,实现无偏的 on-policy 优化。我们进一步在重要性采样权重上引入幂缩放因子,使策略能有选择地从探索性的分布外轨迹中学习,同时保持优化稳定。实验表明 Ctrl-R 能有效探索并内化此前无法获得的推理模式,在语言与视觉语言模型的数学推理任务上带来一致改进。
