论文
医疗记录中的冗长上下文问题
The Verbose Context Problem in Medical Records
摘要
当结构化概念具有词元效率低下的文本表示时,就会出现冗长的上下文问题。这一瓶颈在人口健康方面非常严重:纵向患者记录的队列级分析需要对数千个医学编码事件进行推理,这些事件总数通常超过 40 万个标记。我们提出了 PopMedQA,这是一个通过对纵向患者记录组进行计算任务来隔离此问题的基准。我们使用 NeoPatent 构建基准,这是一个用于语言控制生成人工患者记录的新库。通过广泛的消融——包括提示策略、提示压缩和代理分解——我们发现与领域无关的方法无法缓解冗长的上下文问题。利用语言模型输入中的特定领域结构进行人口规模推理仍然存在很大的机会。