论文
从记忆到吸收:用于持续知识注入的混合策略强化学习
From Memorization to Absorption: Mixed-Policy RL for Continual Knowledge Injection
摘要
持续的知识注入对于使 大语言模型 在快速发展的世界中保持最新状态至关重要。现有方法依赖于有监督的 微调 (SFT),它会记住训练格式中注入的事实,但无法泛化释义、文档组合和推理。为了解决这个问题,我们提出了 Golden-GRPO 注入(GRIN),这是一个用于持续知识注入的三阶段自学习框架。 Golden-GRPO 是一种专为知识注入而设计的混合策略强化学习算法,即使 同策略 在新事实上采样轨迹失败,它也会注入标准答案以提供学习信号。我们进一步介绍了 Blank 和 Counter,这是两个分别针对新颖获取和反事实覆盖的文档级基准,每个基准都评估单事实回忆、多源检索和推理。我们的实验建立了一个明确的实证主张:混合策略强化学习能够使知识吸收超出监督 微调 所能达到的水平。 GRIN 在较难的问题类型上大大优于 SFT 和混合策略 RL 基线,同时在基本事实回忆上与它们匹配。