论文
序列化策略影响大模型用药核对:FHIR数据格式比较
Serialisation Strategy Matters: How FHIR Data Format Affects LLM Medication Reconciliation
摘要
临床交接中的用药核对风险较高且容易出错。大模型常被用于处理FHIR结构化患者记录,但输入前如何序列化仍缺少研究。我们比较原始JSON、Markdown表格、临床叙述和时间线四种方式,使用Phi-3.5-mini、Mistral-7B、BioMistral-7B、Llama-3.1-8B与Llama-3.3-70B五个开放权重模型,在200名合成患者的受控基准上进行4000次推理。对8B及以下模型,格式具有显著影响:Mistral-7B的临床叙述相对原始JSON最高提高19个F1点(r=0.617,p<10^-10)。这一优势在70B模型上反转,原始JSON的平均F1最高,为0.9956。全部20组模型与格式组合中,平均精确率均高于召回率,主要错误是漏掉在用药物而非虚构药物,影响安全审查重点。小模型在约7至10种同时在用药物时趋于饱和,使多药并用患者更容易漏检。仅领域预训练、未经指令微调的BioMistral-7B在全部条件下都无可用输出,说明领域预训练不足以保证结构化抽取能力。基于所测模型,研究建议小模型优先使用临床叙述,70B模型使用原始JSON。完整流程可在AWS g6e.xlarge实例的NVIDIA L40S 48GB显存上以开源工具复现。