论文
LLM能遵循医学专家逻辑吗?偏倚风险评估的层级一致性基准
Can LLMs Follow Medical Expert Logic? A Benchmark for Hierarchical Logical Consistency in Risk-of-Bias Assessment
摘要
循证医学要求严格的逻辑一致性,但目前对大语言模型(LLM)的评估优先考虑肤浅的标签匹配而不是真正的推理。我们推出 LogiMed-RoB,这是一个基于 Cochrane 偏倚风险 (RoB) 2.0 专家逻辑的基准,包含 860 项随机对照试验 (RCT) 和 14,820 项查询。它从四个维度评估层次逻辑一致性 (HLC) 框架下的模型:原子一致性、域一致性、聚合一致性和证据忠实性。对 10 个最先进的 LLM 进行的实验揭示了灾难性的错误复合效应:尽管顶级模型达到了 98.88% 的原子一致性,但其端到端一致性却跌至 45.13%,几个开放权重架构暴跌至接近 0%。我们进一步发现了一个系统性的证据推理差距:即使模型检索到高质量的证据,它们在 18.63-40.05% 的案例中也无法推断出正确的结果,而盲猜率达到 48.28%。 LogiMed-RoB 证明,高结果准确性可以掩盖关键的推理缺陷,强调了临床部署白盒逻辑验证的必要性。