论文
面向小型搜索Agent的可验证奖励强化学习
Reinforcement Learning with Verifiable Rewards for Small Search Agents
摘要
可验证奖励强化学习(RLVR)在数学、编程等奖励明确的问题上表现良好,但它是否也适用于奖励不那么明确的场景仍是开放问题。reason-over-search配方将RLVR应用于开放域问答:检索为答案提供依据,与参考答案的匹配提供奖励。迄今它只在大模型上得到验证,十亿参数以下仅有从更大教师蒸馏的案例。我们在一个小模型上测试该配方。我们用组相对策略优化(GRPO)与交错的Wikipedia搜索工具在MuSiQue上训练Qwen3.5-0.8B,仅在三种奖励形状上变化、每种三个种子,并在七个基准的问答套件上评测每个留出的checkpoint。该配方有效:最佳运行达到0.352的平均精确匹配,对照未训练的0.092基线为3.8倍增益,且训练循环中没有蒸馏步骤。奖励形状也很重要。在匹配的训练步数下,忠实于Search-R1的仅精确匹配奖励在所有种子上都是三者中最差的,甚至在它直接优化的精确匹配指标上也最差。我们的结论是:稀疏精确匹配奖励——RLVR在数学与代码上的默认选择——对这一规模的模型是错误的起点。reason-over-search设置可以为小模型的RLVR提供合适奖励,但小模型RLVR需要自己的奖励设计研究,而非大模型配方的缩小版。
