论文
超越数学和代码:基于轻量级语料库的事实问答过程奖励
Beyond Math and Code: Lightweight Corpus-Grounded Process Rewards for Factual Question Answering
摘要
强化学习 (RL) 期间的过程监督 后训练 在事实问答 (QA) 中很重要,因为收到积极响应级别奖励的响应仍然可能包含句子级别的事实错误。与数学和代码不同,事实 QA 缺乏廉价的程序检查,这使得奖励计算成为瓶颈。现有方法依靠神经验证器对单个句子进行评分,需要广泛的模型推理,因为 RL 在每次更新时都会对许多采样响应重复这些检查。因此,我们引入了 CorVer(语料库验证),这是一种轻量级的过程监督训练时间方法,可从语料库共现统计中获得句子级奖励。 0.5B 提取器识别主宾对,索引语料库查询提供其共现计数,并将生成的句子奖励分配给 RL 的相应标记。在 Qwen3-4B 和 Qwen3-8B 上,相对于四个事实强化学习基线,CorVer 将平均完成训练时间减少了 5.5-10.4 倍。在根据这些基准评估的四个模型中,CorVer 在 20 个模型基准设置中的 17 个中实现了最高准确度。 CorVer 在所有 30 个标准事实 QA 设置(五个基准中来自三个系列的六个模型)中均优于未修改的模型,并且在另外两个多跳 QA 数据集上仍然有效。