论文
AcuityBench:评估临床急迫度识别与不确定性对齐
AcuityBench: Evaluating Clinical Acuity Identification and Uncertainty Alignment
摘要
我们提出AcuityBench,一个评估语言模型能否从用户医学主诉中识别恰当救治紧急程度的基准。现有健康类基准强调医学问答、广泛的健康交互或狭窄的工作流专用分诊任务,但没有对这些场景下的急迫度识别提供统一评估。AcuityBench通过在共享的四级急迫度框架(从居家监测到立即急诊救治)下统一整合五个公开数据集来填补这一空白,数据涵盖用户对话、在线论坛帖子、临床案例场景与患者门户消息。该基准包含914个病例,其中697个共识病例用于标准准确率评估,217个经医生确认的模糊病例用于不确定性感知评估。它支持两种互补的任务形式:QA设定下的显式四分类,以及以同一框架为锚、用基于量规的评审来评估的自由格式对话回复。在12个前沿专有与开放权重模型上,我们发现清晰病例的急迫度准确率和错误方向存在显著差异。对比任务形式揭示出系统性权衡:与QA相比,对话式回复减少了过度分诊但增加了分诊不足,尤其在急迫度较高的病例中。在模糊病例中,没有模型能贴近医生判断的分布,且模型预测比专家临床不确定性更为集中。我们还在最大程度模糊的病例子集上比较了专家与模型的裁定,用这些病例考察临床不确定性在标签分歧中的作用。总体而言,这些结果将急迫度识别定位为一项独特的安全关键能力,并表明AcuityBench能够对模型在真实健康场景中引导用户到达恰当救治层级的水平进行系统比较与压力测试。
