论文

LLM能够构建强大表征并简化样本高效的监督学习

LLMs can construct powerful representations and streamline sample-efficient supervised learning

上下文与知识上下文工程

摘要

随着现实世界的数据集变得越来越复杂和异构,监督学习常常受到输入表示设计的瓶颈。为下游任务(例如时间序列、自由文本和结构化记录)建模多模态数据通常需要不平凡的特定领域工程。我们提出了一个代理管道来简化这个过程。首先,大语言模型在上下文中分析一小部分但多样化的文本序列化输入示例,以合成全局标题,该标题充当提取和组织证据的程序规范。然后,使用该标题将输入的原始文本序列化转换为下游模型的更标准化的格式。我们还描述了当地的标准,这是由大语言模型生成的任务条件摘要。在 EHRSHOT 基准的 15 项临床任务中,我们基于标题的方法显着优于传统的计数特征模型、基于朴素文本序列化的 LLM 基线以及临床基础模型(该模型是根据更多数量级的数据进行预训练的)。除了性能之外,量规还为运营医疗保健环境提供了多种优势,例如易于审计、大规模部署的成本效益,并且它们可以转换为表格表示形式,从而解锁一系列机器学习技术。

LLM能够构建强大表征并简化样本高效的监督学习:论文配图
图 1:EHRSHOT 基准中 6,739 名患者的所有 15 项临床预测任务的平均性能(Wornow 等人,2023 年)。我们由 LLM 代理构建的量规式表示优于 Hegselmann 等人中基于朴素文本序列化的 LLM 基线。 (2025),以及对 257 万患者进行预训练的临床基础模型 (CLMBR-T,(Wornow 等人,2023)) 和基于计数特征的梯度提升机 (Count-GBM,(Ke 等人,2017;Wornow 等人,2023))。