论文

知识到验证:在知识密集型领域探索 LLM 的 RLVR

Knowledge-to-Verification: Exploring RLVR for LLMs in Knowledge-Intensive Domains

模型训练强化学习

摘要

具有可验证奖励的强化学习(RLVR)已显示出增强 大语言模型(LLM)在数学和编码等领域的推理能力的巨大潜力。然而,由于缺乏高质量的可验证数据,其在知识密集型领域的应用尚未得到有效探索。此外,当前的 RLVR 仅关注最终答案的正确性,导致推理缺陷和奖励信号稀疏的局限性。在这项工作中,我们提出了知识到验证(K2V),这是一个通过自动可验证数据合成将 RLVR 扩展到知识密集型领域的框架,同时能够验证 LLM 的推理过程。大量实验表明,K2V 增强了 LLM 在知识密集型领域的推理能力,而不会显着损害模​​型的一般能力。这项研究还表明,将自动化数据合成与推理验证相结合是增强这些更广泛领域的模型能力的一个有前途的方向。代码可在 https://github.com/SeedScientist/K2V 获取。