论文
RASC+:临床值集创作的检索约束 LLM 裁决
RASC+: Retrieval-Constrained LLM Adjudication for Clinical Value Set Authoring
摘要
临床值集定义了质量测量、表型分析、队列构建和临床决策支持中使用的标准化术语代码。最近推出的检索增强集完成 (RASC) 基准测试表明,直接零样本 大语言模型 (LLM) 生成不太适合此任务:临床代码系统很大、受版本控制,并且不能被语言模型可靠地记忆。我们研究了一种分阶段的替代方案,其中候选池构建针对召回进行了优化,受约束的 LLM 裁决器针对候选选择进行了优化。在完整的 3,744 个值集 RASC 测试拆分中,基于 Qwen3 的检索具有词汇感知扩展和代码显示救援检索,将候选池召回率从原始 RASC 检索基线的 0.553 提高到 0.730;在保留的出版商层,池召回率为 0.655。单独的更高召回率池是不够的:将原始 SAPBert 交叉编码器应用于此扩展池可得到 0.287 的完整测试宏 F1 和 0.233 的保留发布者宏 F1。在同一池上用盲法 GPT-5 裁决替换第 2 阶段选择器会将完整测试宏 F1 增加到 0.549,并将保留发布者宏 F1 增加到 0.533。这些结果表明,检索约束的 LLM 裁决可以显着提高值集完成度,同时保留所有返回代码必须来自可审核候选池的安全约束。