论文
PSEBench:面向患者安全事件分诊中LLM的受控可验证基准
PSEBench: A Controllable and Verifiable Benchmark for Evaluating LLMs in Patient Safety Event Triage
摘要
患者安全事件分类,确定临床事件是否应根据管辖区特定政策进行报告,是一项高风险任务,通常由患者安全专家手动执行。尽管大语言模型可能支持这种工作流程,但由于缺乏基准来捕获基于证据的政策推理、主动寻求不完整报告的信息以及在不可简化的模糊案例中原则上放弃,可靠的评估受到限制。我们通过以条款卡为中心的基于政策的构建方法来解决这一差距,这是一种将监管文本分解为可审计决策规范的结构化表示。将子句卡与锚驱动的实例化和闭环验证相结合,我们的可扩展管道可以生成具有构建基础事实的叙述,并自然地支持生成丢失的信息和不确定的变体。我们在明尼苏达州的 29 个可报告的不良健康事件上实例化了该方法,生成了 PSEBench,这是一个具有代理评估环境的 5,074 例基准测试。对 15 个具有代表性的大语言模型的评估揭示了一致的能力趋势,展示了基准的实用性,并确定了与可靠的基于大语言模型的患者安全事件分类之间的可操作差距。
