论文
RxEval:用于评估 LLM 药物建议的处方级基准
RxEval: A Prescription-Level Benchmark for Evaluating LLM Medication Recommendation
摘要
住院药物推荐需要临床医生根据患者病情的发展反复选择特定的药物、剂量和途径。现有的基准将这项任务制定为通过多热诊断和程序代码输入对粗略药物代码进行准入级预测,未能捕获真实处方的每个时间点、信息丰富的性质。我们提出了 RxEval,一种处方级基准,通过多项选择问题评估 LLM 处方能力:每个问题都提供详细的患者概况和按时间排序的临床轨迹,需要从真实处方中选择特定的药物剂量路线三元组和通过推理链扰动生成的患者特定干扰项。 RxEval 包含 1,547 个问题,涵盖 584 名患者、18 个诊断类别和 969 种独特药物。对 16 个 LLM 的评估表明,RxEval 既具有挑战性又具有区分性:各个模型的 F1 范围为 45.18 到 77.10,最佳精确匹配仅为 46.10%。误差分析表明,即使是前沿模型也可能忽略所陈述的患者信息,而无法得出临床结论。