论文

MedHal-Loc:“可通过架构解释”的医学幻觉探测器是忠实的定位器吗?本地化基准

MedHal-Loc: Are "Explainable-by-Architecture" Medical Hallucination Detectors Faithful Localizers? A Localization Benchmark

模型评测基准与评测资源

摘要

在临床文本中检测幻觉越来越被视为一个可解释性问题:系统不仅应该标记不可靠的响应,还应该指出令人讨厌的范围。围绕知识图(KG)三重分解构建的架构正是为了这种可审计性而销售的,但它们的本地化能力通常是假设的,而不是测量的。我们引入了 MedHal-Loc,这是定位 忠实性 的基准和度量——检测器的顶级错误单元是否实际上与错误跨度重叠。受控子集包括 300 个 PubMedQA 派生语句,其中包含跨四种可本地化类型(实体替换、关系错误、机制错误归因、发明)注入的单个跨度级别错误,通过构建产生金标准文本片段;一个互补的自然子集记录了真实的幻觉是由抵抗跨度定位的扩散性结论翻转所主导的(人类专家接受了 1/18 候选跨度)。评估四种细粒度范式,我们发现 NLI-per-clause、consistency-per-sentence 和专用跨度检测器 FAVA 的定位都远高于机会,而精心设计的 KG 三重管道的定位并不比机会更好(+3.3pp,n.s.),尽管有竞争性检测 F1(0.609),但仍受到约 59% 实体提取覆盖率的瓶颈。检测能力并不意味着忠实的定位;架构的可解释性必须经过验证,而不是推测。