论文

TREK:提炼探索,强化完善

TREK: Distill to Explore, Reinforce to Refine

模型训练强化学习

摘要

当当前策略已经对有用的推理轨迹进行采样时,组相对策略优化 (GRPO) 是有效的,但它会在硬提示上停止,而硬提示的正确解决方案模式不在学生的 同策略 支持范围内。我们提出 TREK(通过 Forward KL 的教师路由探索),这是一个简单的分阶段过程,它使用 蒸馏 不是为了模仿,而是为了探索支持扩展。 TREK 的一个关键优势是它的通用性:因为它只消耗经过验证的输出轨迹,所以它可以使用外部黑盒教师、白盒教师或给定额外推理时间上下文的相同模型,并且即使在教师内部不可用的情况下,它也可以有效地识别哪些硬提示样本最值得巩固。 TREK 首先识别未受帮助的学生通过率非常低的提示,查询提案源以生成经过验证的候选解决方案,根据当前学生可能性排名前 $r$ 提案,应用简短的前向 KL 阶段将这些经过验证的模式纳入学生的支持中,然后返回到标准 同策略 GRPO 细化。在数学推理方面,TREK 与 DeepSeek-V4 提案在 AIME 2024 和 AIME 2025 上的所有测试尺度上改进了 Qwen3 模型;对于 Qwen3-8B,它将 AIME 2025 从 36.9 提高到 40.3,AIME 2024 从 47.9 提高到 51.1 (avg@16),而自我上下文变体在没有外部教师的情况下达到 38.5 和 49.6。在代理任务上,TREK 将 ALFWorld 成功率从 75.8 提高到 82.8,将 ScienceWorld 成功率从 12.5 提高到 26.7;值得注意的是,在最困难的任务类型上,TREK 在训练早期就取得了很高的成功率,而在没有辅助的情况下,GRPO 需要更多的优化步骤才能达到相当的水平。