论文

从视网膜证据到安全决策:用于医疗LLM幻觉风险分流的RETINA-SAFE与ECRT

From Retinal Evidence to Safe Decisions: RETINA-SAFE and ECRT for Hallucination Risk Triage in Medical LLMs

模型评测安全与风险评测

摘要

医疗大语言模型(LLM)中的幻觉仍然是一个安全关键问题,尤其是在可用证据不足或相互冲突时。我们在糖尿病视网膜病变(DR)决策场景中研究这一问题,并提出RETINA-SAFE,一个与视网膜分级记录对齐、以证据为根基的基准,包含12,522个样本。RETINA-SAFE被组织为三个证据关系任务:E-Align(证据一致)、E-Conflict(证据冲突)和E-Gap(证据不足)。我们进一步提出ECRT(Evidence-Conditioned Risk Triage),一个两阶段白盒检测框架:第一阶段执行安全/不安全风险分流,第二阶段将不安全案例细分为矛盾驱动型与证据缺口型风险。ECRT利用CTX/NOCTX条件下的内部表示与logit变化,并采用类别平衡训练以实现稳健学习。在多个骨干模型上采用按证据分组(而非按患者不重叠)的划分时,ECRT提供了强劲的第一阶段风险分流和明确的子类型归因:第一阶段平衡准确率较外部不确定性与自一致性基线提升+0.15至+0.19,较最强的适配监督基线提升+0.02至+0.07,并在第一阶段平衡准确率上持续超过单阶段白盒消融。这些发现支持以视网膜证据为根基的白盒内部信号,作为可解释医疗LLM风险分流的一条实用路径。

从视网膜证据到安全决策:用于医疗LLM幻觉风险分流的RETINA-SAFE与ECRT:论文配图
图 3:ECRT 框架概述。 ECRT 利用 CTX/NOCTX 条件下的内部表示和逻辑变化来提取三个系列的安全信号(差异、偏差、不连贯)。这些功能训练一个两阶段分类引擎,该引擎可以检测风险并将其归因于临床矛盾或证据差距类别。