论文
从词元到词元对:临床预测中 大语言模型 的高效即时压缩
From Token to Token Pair: Efficient Prompt Compression for Large Language Models in Clinical Prediction
摘要
通过将电子健康记录 (EHR) 处理为自然语言序列,大语言模型 (LLM) 在死亡率预测和表型分析等临床预测任务中显示出潜力。然而,纵向或高频的 EHR 通常会产生过长的词元序列,从而导致较高的计算成本,甚至降低性能。现有的解决方案要么添加压缩模块,要么删除不太重要的标记,这会引入额外的推理延迟或丢失临床信息的风险。为了在不增加成本或性能损失的情况下实现词元序列的无损压缩,我们提出了医疗词元对编码(MedTPE),这是一种扩展 EHR 序列标准词元化的分层方法。 MedTPE 将频繁同时出现的医疗词元对合并为复合词元,提供无损压缩,同时通过依赖性感知替换策略保留计算复杂性。仅 LLM 参数的 0.5-1.0% 的新引入词元的嵌入是通过自监督学习进行微调的。对两个临床场景的真实数据集进行的实验表明,MedTPE 将输入标记长度减少了 31%,推理延迟减少了 34-63%,同时在多个 LLM 和四个临床预测任务中保持甚至提高了预测性能和输出格式合规性。此外,MedTPE 展示了跨不同输入上下文长度的稳健性以及对科学和金融领域以及不同语言的通用性。