论文
ConRub-Med:使用开放式医学问答的共识标准进行强化学习
ConRub-Med: Reinforcement Learning with Consensus Rubrics for Open-Ended Medical Question Answering
摘要
具有可验证奖励的强化学习在数学和编码领域尤其有效,可以自动检查答案。许多开放式医学问题缺乏相对便宜的结果验证器:回答可能部分正确、不完整或包含临床上严重的错误。由医生编写或验证的评分标准提供了强有力的临床基础,但在每种情况下都让专家参与是昂贵的。模型生成的规则使这种监督具有可扩展性。我们引入 ConRub-Med 是为了在标题反馈从构建转向政策优化时保留有用的区别。对于每个提示,三个异构语言模型独立提出原子标准;一个单独的模型对它们进行审查,仅保留来自所有三个生成器的语义支持的标准。三态评分区分正确的报道、缺失的信息和不正确的声明。错误会得到负积分而不是零积分。当完整的组相对策略优化 (GRPO) 组中的每个响应都收到相同的最终奖励时,仅当两个候选订单都同意时,成对判断才会提供序列优势,而不改变标量奖励。没有联系的团体使用普通的 GRPO。在一项与问题相匹配的盲法研究中,两位医学专家将整个管道中的面板评价为比一台发电机生产的面板更具临床相关性。在评估的开放模型中,ConRub-Med 在九项基准中的六项中排名第一,并达到了最高的医学和概括平均值。使用包含 5,166 个提示的标题数据集,它在 HealthBench-Hard 上的得分为 $38.98 \pm 1.04$(平均 $\pm$ SD),而 InfiMed-ORBIT 在 8,000 个样本中的得分为 33.60,在 28,000 个样本中的得分为 37.30。