论文

MamaBench:通过反事实临床扰动对 LLM 母婴健康诊断的稳健性进行基准测试

MamaBench: Benchmarking LLM Robustness in Maternal and Child Health Diagnosis through Counterfactual Clinical Perturbation

模型评测鲁棒性、公平性与可信度评测

摘要

大语言模型 在医学基准上取得了很高的分数,但这些基准单独评估每个问题,无法衡量系统是否可以区分需要不同干预的临床相似表现。我们推出了 MamaBench,这是针对孕产妇和儿科 AI 的第一个反事实基准:针对 371 种病理学的 217 对 434 个专家撰写的临床叙述,通过偏差陷阱率 (BTR) 进行评估,即在基本案例成功的情况下,模型未能达到反事实的条件概率。我们提出了证据锚定 RAG (EA-RAG),这是一种三阶段检索方法,通过临床参数提取、覆盖审计和对比子查询,用证据覆盖目标取代聚合相似性。在四个前沿 LLM 的八种配置中,每个模型的基本精度都高估了鲁棒精度 16-28 个百分点。 EA-RAG 在 Claude Sonnet 4.6 上实现了 20.3% 的 BTR 和 65.0% 的鲁棒精度,在不降低基本精度的情况下,BTR 降低了 5.5 个百分点。剩余的 20% BTR 证实临床 AI 中的反事实稳健性仍然是一个开放的挑战。关键词:反事实评估、临床人工智能、孕产妇保健、检索增强生成、诊断稳健性