论文
训练前的表示:生成医疗事件模型标记化的实用基准
Representation Before Training: A Practical Benchmark for Generative Medical Event Model Tokenization
摘要
生成医疗事件模型使用患者时间线的标记化序列作为输入,但围绕标记化的许多决策的实际指导是有限的。我们对量化粒度、参考范围锚定、代码值融合、数字和时间编码以及来自专家映射的通用数据模型的本机事件表示与协调事件表示进行基准测试。使用 Llama 和 Qwen 架构,156 个模型通过三个初始化种子进行了全面住院训练,每个配置都遵循最多五个时期的共享训练方案。我们使用线性探针评估了住院前 24 小时的学习表征,以预测 24-48 小时内的二元和连续结果。与等效的未融合标记化输入相比,具有价值十分位数的融合标记配对代码提高了所有八个结果系列的性能,接收者操作特征曲线下面积 (AUROC) 增益为 $+0.002$ 至 $+0.033$,Spearman 相关增益为 $+0.025$ 至 $+0.114$。将值箱锚定到参考范围或增加量化粒度都无法持续提高性能,而 xVal 变体的性能均低于离散编码和软编码。显式时间标记的替代方案,例如事件顺序和准入相对旋转位置嵌入 (RoPE),在所有八个族中产生了更高的族平均点估计,同时减少了输入长度。当根据映射到通用纵向重症监护病房数据格式 (CLIF) 的输入评估本机输入时,CLIF 全住院训练序列包含的标记数量是本机序列的 28.6%,并且八个结果系列中的六个的性能得到提高。这些发现表明,在学习下游分类和回归任务的患者表征时,标记化和事件编码是相应的设计选择。