论文

LLM提高医生答题准确率,也可能诱发对错误建议的依赖

Large language models improve physician accuracy but lead to false reliance

模型评测安全与风险评测

摘要

增强检索的大语言模型(LLMs)在提供源链接临床支持方面具有潜力,但其价值取决于证据是否引导而非误导医生的依赖。我们开发了CORA,一个增强检索的LLM,以研究源链接辅助如何影响医生的决策。CORA保持基准性能,并在模型训练数据截止点之后发布的案例中取得了更大的改进。在一项针对46名医生的研究中,未辅助时的准确率从70.8%提高到82.6%。支持引用预测正确答案(87.7% vs 65.5%),但引用创建了一个重要的不对称性:医生认为支持后,正确建议的采纳率从34%提高到76.9%,但在出现错误的LLM答案时,引用支持的医生对它表现出更高的抵抗(从92%降低到34.8%)。这些发现表明,源链接LLM辅助可以提高医生的准确率,同时引入一个依赖于基础的潜在风险。