论文
决定、询问或推迟:证据不完整的临床LLM
Decide, Ask, or Defer: Clinical LLMs under Incomplete Evidence
摘要
临床LLM不仅必须决定做出什么诊断,还要决定现有证据是否足以进行自主决策。二元决策/放弃公式合并了不同的非决策状态,并且不明确评估信息获取。我们引入了 DECIDE/ASK/DEFER 公式以及防止模型使用证据完整性元数据的盲协议。我们根据 DDXPlus 构建的 200 个匹配的临床证据状态评估 Qwen、Gemini 和 GPT。这些模型显示,在相同证据下,行动选择存在显着差异,200 个州中有 137 个州存在分歧。对于 Qwen 来说,匹配的目标与随机分析表明,选定的信息比诊断正确性更明显地改变了后续自主决策的可能性。其匹配的决定/放弃基线进一步揭示了安全自主权衡:三个动作策略挽救了一些错误的自主决策,但也删除了一些正确的自主决策。这些结果表明,将信息获取与临床医生延迟分开会暴露二元弃权隐藏的行为,而不会产生一致改进的决策策略。