论文

HindSearch:搜索增强强化学习的轨迹级后见之明批评

HindSearch: Trajectory-Level Hindsight Critique for Search-Augmented Reinforcement Learning

摘要

搜索增强的 LM 代理通常使用二元精确匹配奖励进行训练,这会丢弃失败轨迹告诉我们的失败原因的大部分内容。我们介绍 HindSearch,GRPO 的事后自我 蒸馏 程序:每次执行轨迹后,冻结的法官都会使用标准答案对每条失败的轨迹进行简短的批评,并且该批评为学生的搜索操作提供了辅助 同策略 蒸馏 信号。在带有 Qwen2.5-3B-Instruct 的标准七基准套件上,HindSearch 的平均 EM 达到 39.4%,优于之前的搜索 RL 基线。取消法官对标准答案的访问会消除大部分收益,从而将事后诸葛亮作为改进的源泉。