论文

CARE-Bench:面向患者的LLM分诊基准

CARE-Bench: Benchmarking Patient-Facing LLM Triage

模型评测基准与评测资源

摘要

面向患者的医疗LLMs和代理在患者与临床医生联系之前回答症状问题,其中关键的安全问题是用户下一步应该采取什么行动。我们介绍CARE-Bench,这是一个源导向基准,用于评估连续的面向患者的分诊决策作为四类标签的每回合当前行动任务。CARE-Bench包含500个案例和1,059个重构自医疗对话、咨询和后续问题来源的患者披露前缀。作者在269个留出的评估轮次上测试11个模型,分别采用无提示与最小提示的开放式协议,使用固定GPT-5.5映射器将每个响应编码到四类行动空间中。无提示的宏平均F1分数仍然很低,范围从31.2到50.4。提示改进了11个模型中的10个,提示后的宏平均F1分数范围从46.9到63.4,但显著的阈值错误仍然存在。提示模型经常推荐在需要进一步澄清之前采取护理措施;当正确的行动是要求更多信息时,只有33.5%的提示输出保留了步骤。这些错误在提示后仍然存在,表明面向患者的分诊决策不是简单的提示问题,并支持在部署前明确评估行动时间点。

CARE-Bench:面向患者的LLM分诊基准:论文配图
图 2:CARE-Bench 案例构建的工作示例。源事实和临床医生未解答的问题被抽象为约束条件和病例级行动规则; GPT-5.5 将它们在人工复核下重新组织成逐轮披露。第一轮是标准标签为 InfoNeeded;第 2 轮披露回答了因素 (1)-(6),产生了 NonurgentCare。参见第 3.1-3.3 节。