论文

作为训练信号的本体概念重叠:临床问答的基于知识的强化学习

Ontology Concept Overlap as a Training Signal: Knowledge-Grounded Reinforcement Learning for Clinical Question Answering

模型训练奖励建模与过程监督

摘要

语言模型的强化学习后训练依赖于两种奖励设计:人类偏好(RLHF、DPO)和二进制验证器(RLVR)。临床问答两者都不适合。接近正确的答案因单个替换实体而异,并且没有可执行的检查来决定临床正确性。我们从维护的受控词汇中实例化一个软验证器:UMLS 概念唯一标识符重叠(通过 scispaCy,设置级别 F1)给出分级的、外部指定的奖励,无需循环中的模型即可计算。我们将其在 GRPO 内部与熵归一化的LLM判断相结合,该判断涵盖了无法看到的安全和证据轴重叠,以及对填充和重复的小的一致性惩罚,以保持早期训练样本的可评分。这个三项复合材料在 Phi-3-mini (3.8B) 上的 SFT 比 MedQA 上的 SFT 提高了 2.9%(0.700 vs 0.680),在token-F1 上提高了 39%(0.202 vs 0.145);在 Llama-3.2-3B 上,EM 上的相应增益为 14%,token-F1 上的相应增益为 35%。我们将token-F1 报告为主要指标,因为它归功于 EM 在这种开放一代规模中丢弃的部分正确的临床内容。主表结果是 3 个种子的平均值,标准差低于 0.005。该方法转移到 PubMedQA,其中具有相同复合奖励的 PubMedQA 训练集上的训练在 Phi-3-mini 上比 SFT 提高了 22%,在 Llama-3.2-3B 上提高了 17%,无需重新调整。 Phi-3 上的奖励消融,以固定的一致性权重改变法官-本体划分,将 3 个 EM 点归因于本体术语,即捕获法官无法替换的实体替换的贡献。三个负面结果限制了设计:随机负数下的 DPO 对于强先验模型的表现不如 SFT,但对最弱先验模型有帮助;稀疏神经奖励下的 PPO 发散; KL 亏损的 GRPO 崩溃至 7B。

作为训练信号的本体概念重叠:临床问答的基于知识的强化学习的原论文方法或结果图
图 1. 综合奖励 GRPO。 策略对每个问题的 $G{=}4$ 响应进行采样;每个都由冻结的LLM判断、UMLS CUI 与参考的重叠以及填充和重复的一致性惩罚来评分。这三项按等式组合。 1($\alpha{=}0.6$、$\beta{=}0.3$、$\gamma{=}0.1$)。组标准化优势更新了 LoRA 适配器。参考和判断在训练中保持冻结状态。