论文

哪些医学问题值得解释?稳健 QA 的扰动敏感选择

Which Medical Questions Deserve Rationales? Perturbation-Sensitive Selection for Robust QA

模型训练合成数据

摘要

医学问答数据集通常包含答案标签,而高质量的推理解释仍然稀缺、嘈杂或验证成本高昂。这改变了获取问题:我们不问哪些问题应该被标记,而是问哪些已经标记的问题应该在固定的 词元预算 下接受推理解释监督。我们研究了该问题的离线版本,其中候选理由对选择者可见,但除非被选择,否则不会参与下游训练。我们提出基于均方根稳健性的样本优先级(RMS-RSP),它仅在推理解释标记处扰乱隐藏状态,并测量正确选项与最佳干扰项的间隔的变化。在五个医学 QA 数据集、MedGemma-4B-IT、三个训练种子、十个预算的非 RSP 选择器和一个未预算的全面监督参考中,RMS-RSP 提供了故意合格的结果。其锁定预算准确度平均为 60.61%,而 Random 为 60.08%,仅在 AfriMed-QA 上有统计上解决的增益(+1.44 点)。它的全预算精度区域并不比Random更好。然而,经过 3 次答案选项重新排序后,RMS-RSP 在所有五个数据集上的方向相同,平均分别将鲁棒准确性和语义一致性提高了 1.91 点和 2.85 点。对每个候选池中的推理解释进行训练将宏观准确率提高到 63.74%,但消耗的推理解释词元增加了 29--254 倍,并且并不能统一提高鲁棒性。这些发现并未建立普遍的准确性提升;相反,他们认为推理解释局部边界敏感性可以识别监督,从而提高语义等效格式更改的不变性。