论文
MedFabric:标准证据掩盖了医学词级事实编造检测的难度
MedFabric: Gold Evidence Hides the Difficulty of Word-Level Medical Fabrication Detection
摘要
大语言模型会在医学内容中生成流畅但事实错误的陈述,因此可靠的事实编造检测是临床部署前提。现有进展受两种评测偏差夸大:人工真实文本与 LLM 幻觉文本配对,使检测器利用作者风格而非事实;测试时直接提供标准证据。评估事实推理的基准需要消除风格捷径,让每项编造都对应可真实检索的段落,并覆盖部署中不同质量的证据。MedFabric 按这些要求构建,包含646项词级医学编造,每项都配有同样由 LLM 撰写、表面形式几乎相同的真实文本,ROUGE-L 中位数为0.95。任务仍未解决:专家临床医生宏平均 F1 仅53.3%,不提供标准证据时,没有检测器类型超过约60%。核心发现是,证据是否正确比编造是否细微更能决定检测表现:一个强 LLM 使用标准段落时得分91%,使用错误段落时降至35%,甚至低于不使用证据的基线。这一模式在两个基准、两种模型规模下均成立。针对问题,研究用检索置信度门控拒用低置信证据,将宏平均 F1 从61%提升至74%,并公开基准、代码和全部基线。