论文

C-MIG:面向临床诊断推理的多视角信息增益检索增强生成

C-MIG: Multi-view Information Gain-based Retrieval-Augmented Generation for Clinical Diagnosis Reasoning

模型训练强化学习RLVR

摘要

检索增强生成与强化学习相结合,已显示出将大语言模型锚定于可信医学证据的潜力。然而,现有方法依赖精确匹配的二元奖励,这在临床诊断中造成两个问题:(i)语义相关但非逐字一致的步骤得到零信号,浪费了宝贵的学习信号;(ii)单维度奖励无法有效监督异构的推理能力。为解决这些问题,我们提出C-MIG,一个面向临床诊断的基于多视角信息增益的检索增强生成框架。C-MIG在冻结的参考模型下,从检索文档与文档精炼这两个互补视角估计信息增益,以共同指导检索什么与如何精炼,缓解有价值奖励信号丢失与贡献归因问题。我们进一步设计了多子查询检索增强策略,以提高临床诊断场景中的知识召回覆盖面。在四个医学基准上的全面实验表明,C-MIG在所有RAG-RL方法中于域内和域外集合上均取得最佳性能,并在临床诊断上超越最先进的通用LLM。

C-MIG:面向临床诊断推理的多视角信息增益检索增强生成:论文配图
图1:硬过程奖励对语义相关的中间步骤赋零信号,导致奖励稀疏与次优的信用分配,凸显精细过程奖励设计的必要性。