论文

语言模型参与高风险决策:来自急诊分诊的观察

High-Stakes Decisions with Language Models: Insights from Emergency Triage

模型评测模型行为与机制分析

摘要

高风险决策在不确定性下,如医疗紧急情况的优先级排序,不仅依赖于准确的预测,还需要估计不同结果的可能性,并明确权衡不同行动的后果。这些原则长期以来一直是医学诊断和决策制定的基础。然而,语言模型越来越多地用于高风险临床建议,但这些建议没有明确说明决定的规则。在这里,我们展示了使用语言模型进行紧急情况优先级排序可以在一个概率决策框架内理解,为高风险设置中的决策分析提供了一个案例研究。使用从结构化评估消费者优先级排序系统中提取的临床案例,我们分析了在不同的效用函数下,关于紧急情况的治疗建议。我们发现,有能力的语言模型会根据陈述的效用调整建议,揭示出相同的预测结果可以支持截然不同的决策政策。这些发现表明,有效的部署不仅依赖于提高预测,还依赖于明确决策目标。更广泛地说,这表明,用于高风险应用的语言模型应该被视为依赖于预测性能和明确效用的概率决策系统。

语言模型参与高风险决策:来自急诊分诊的观察:论文配图
图 1:紧急分类性能和安全资源权衡。曲线追踪了 GPT-5-mini(据报道为 ChatGPT Health 的支柱)、GPT-5.4、DeepSeek-V4-Pro 和 Claude Fable 5(每个都经过高度推理评估)的引出概率所隐含的安全资源权衡。红星标记了 Ramaswamy 等人记录的 ChatGPT Health 的行为。 (2026),该报告仅识别了 48% 的紧急情况,同时错误地提及了大约 10% 的非紧急情况,这表明资源节约优先于安全。黑色圆圈显示未指定效用权衡时每个模型的工作点。彩色圆圈显示了由明确的成本比提示引起的操作点,表明基于效用的提示可以引导模型进行一系列安全资源权衡。黄色方块标记了安全加权 5:1 成本比下的最佳固定阈值操作点,即当错过紧急情况所受到的处罚是不必要的转诊的五倍时,可最大限度地减少相对于黄金标准临床标签的成本加权误差的概率阈值。其他成本比率选择沿同一曲线的不同点,如扩展数据图 1 所示,其中我们显示了 18 个模型变体。