论文

MedDialBench:参数对抗性患者行为下 LLM 诊断稳健性的基准测试

MedDialBench: Benchmarking LLM Diagnostic Robustness under Parametric Adversarial Patient Behaviors

模型评测基准与评测资源

摘要

交互式医疗对话基准表明,在与不合作的患者互动时,LLM 的诊断准确性会显着下降,但现有方法要么应用没有分级严重性或特定病例基础的对抗行为,要么将患者的不合作减少到单个未分级的轴,并且没有分析跨维度的相互作用。我们推出了 MedDialBench,这是一个基准,可以对个体患者行为维度如何影响 LLM 诊断稳健性进行受控剂量反应表征。它将患者行为分解为五个维度——逻辑一致性、健康认知、表达风格、披露和态度——每个维度都有分级的严重程度和特定案例的行为脚本。这种受控因子设计可实现分级敏感性分析、剂量反应分析和跨维度相互作用检测。通过评估 7,225 个对话(85 个案例 x 17 个配置 x 5 个模型)中的 5 个前沿 LLM,我们发现了一个根本性的不对称性:信息污染(捏造症状)比信息赤字(隐瞒信息)产生的准确度下降大 1.7-3.4 倍,而捏造是唯一在所有五个模型中实现统计显着性的配置(McNemar p < 0.05)。在六个维度组合中,制造是超加性相互作用的唯一驱动因素:所有三个涉及制造的对都产生 0.70-0.81 的 O/E 比(尽管在单独的每个维度下都取得了成功,但符合条件的案例中有 35-44% 在该组合下失败),而所有非制造对都显示出纯粹的加性效应 (O/E ~ 1.0)。探究策略可以缓和赤字,但不能缓和污染:详尽的询问可以恢复隐瞒的信息,但无法弥补捏造的输入。模型表现出不同的漏洞概况,最坏情况下的下降幅度为 38.8 到 54.1 个百分点。