论文
Search-E1:自蒸馏驱动搜索增强推理中的自我进化
Search-E1: Self-Distillation Drives Self-Evolution in Search-Augmented Reasoning
摘要
后训练已成为把语言模型打造成胜任的搜索增强推理智能体的主流配方。近期一系列工作在该标准流水线之上叠加精巧机制以进一步提升性能。这些增强手段或从更强的外部系统引入外部监督,或附加过程奖励模型、回顾性批评者等辅助模块,或用树搜索、多阶段课程重构rollout本身,或以手工设计的奖惩塑造奖励。每种叠加都带来可测量的收益,但也都让训练流水线膨胀,并把配方绑定到未必可得的资源或设计上。我们退一步追问这些机制是否真的必要,并提出Search-E1:一种自进化方法,仅靠原始GRPO与在线策略自蒸馏(OPSD)交错进行,就使搜索增强智能体获得提升。每轮GRPO之后,策略在自己的训练问题上进行rollout。随后以token级前向KL目标,把策略推理时的分布对齐到其在特权上下文下的自身分布,该上下文暴露出一条更高效的同级轨迹。尽管如此简单,该流程仍自然地提供了逐步的密集监督。在七个问答基准上,Search-E1配合Qwen2.5-3B取得0.440的平均EM,在两种规模上均超越所有开源基线。代码与完整版本将很快公开。