论文
是什么让体检员可以接受训练?用于生物医学 QA 的检查引导 RAG 中诊断信号崩溃和 奖励作弊
What Makes a Medical Checker Trainable? Diagnosing Signal Collapse and Reward Hacking in Checker-Guided RAG for Biomedical QA
摘要
医疗 RAG 需要基于证据的声明,因此将声明级 NLI 检查器插入检索增强的 RL 中是直观的。 \textbf{我们发现检查器在训练期间的\emph{输出分布},而不是其保留的准确性,决定了它是否提供可训练的梯度。}我们在四个保留的医疗 QA 基准上比较了 GRPO 训练的医疗 RAG 代理(Qwen2.5-7B,在 Qwen3-4B 和 Llama-3.1-8B 上复制)内作为过程奖励的四个 NLI 检查器后端。出现了三个诊断结果。 \textbf{(i)} 信号崩溃是对数概率特定的:LLM 对数概率评分标签超过 97% 的声明中性 - 将 RL 梯度崩溃到零 - 而校准的 MedNLI 分类器对相同的对进行非简并评分。 \textbf{(ii)} 在答案质量上,中等信号击败强信号:强大的专有检查器触发三步 奖励作弊 级联 - 超短答案、搜索避免、语言崩溃 - 因此中等信号本地分类器训练更高质量的模型(\textbf{+12\% BERTScore 超过零样本,无 GPT 依赖性})。 \textbf{(iii)} 信号强度取决于策略:同一个检查器在一项策略上注册为中等,但在另一项策略上注册为强,而不会触发级联最终状态。我们将这些作为验证者奖励系统的边界条件。