论文

面向小型搜索Agent的可验证奖励强化学习

Reinforcement Learning with Verifiable Rewards for Small Search Agents

模型训练强化学习RLVRAgentic RL

摘要

可验证奖励强化学习(RLVR)在数学、编程等奖励明确的问题上表现良好,但它是否也适用于奖励不那么明确的场景仍是开放问题。reason-over-search配方将RLVR应用于开放域问答:检索为答案提供依据,与参考答案的匹配提供奖励。迄今它只在大模型上得到验证,十亿参数以下仅有从更大教师蒸馏的案例。我们在一个小模型上测试该配方。我们用组相对策略优化(GRPO)与交错的Wikipedia搜索工具在MuSiQue上训练Qwen3.5-0.8B,仅在三种奖励形状上变化、每种三个种子,并在七个基准的问答套件上评测每个留出的checkpoint。该配方有效:最佳运行达到0.352的平均精确匹配,对照未训练的0.092基线为3.8倍增益,且训练循环中没有蒸馏步骤。奖励形状也很重要。在匹配的训练步数下,忠实于Search-R1的仅精确匹配奖励在所有种子上都是三者中最差的,甚至在它直接优化的精确匹配指标上也最差。我们的结论是:稀疏精确匹配奖励——RLVR在数学与代码上的默认选择——对这一规模的模型是错误的起点。reason-over-search设置可以为小模型的RLVR提供合适奖励,但小模型RLVR需要自己的奖励设计研究,而非大模型配方的缩小版。

面向小型搜索Agent的可验证奖励强化学习:论文配图
图 1:无 critic 的 GRPO 循环。对每个问题的一组 G=5 条轨迹进行打分;奖励节点分出三种消融形态(带 0.1 格式下限的 F1、仅 F1,以及稀疏的仅 EM);组均值与标准差构成优势基线,不使用价值 critic;更新采用第 3 节的带裁剪与 KL 正则化的代理目标。一个完整的“推理-搜索-阅读”轨迹示例(展示交错的工具调用以及对检索片段的损失掩码)见附录 0.G。