论文

基于自回归序列模型的条件属性估计

Conditional Attribute Estimation with Autoregressive Sequence Models

模型架构Transformer

摘要

生成模型常用下一词元预测目标训练,但许多下游应用需要估计或控制序列级属性的能力。下一词元预测会导致训练中对局部模式的过拟合和对全局结构的欠拟合,并且在推理时引导或预测生成样本的全局属性,需要对下游进行大量改造或昂贵的采样。在此,我们提出条件属性Transformer(Conditional Attribute Transformers),一种联合估计下一词元概率以及以每个潜在下一词元选择为条件的属性值的新方法。该框架在不修改输入序列的情况下,于单次前向传播中实现三项关键能力:(1) 逐词元贡献归因——通过识别序列中每个词元与属性值的关联,覆盖整个序列;(2) 反事实分析——量化以不同下一词元选择为条件的属性差异;(3) 可引导生成——基于下一词元似然与属性似然的组合来解码序列。我们的方法在稀疏奖励任务上取得最先进性能,在足够大的模型规模下改进下一词元预测,属性概率估计比采样快数个数量级,并能在一系列语言任务上引导自回归序列模型的解码。

基于自回归序列模型的条件属性估计:论文配图
图 5:预测每个token的败血症和最大心率 (HR)。 CAT、Director 和 GPT MC 模拟 (n=64) 的 PhysioNet 2019 脓毒症任务的接收器操作特性 (ROC) 和精确召回 (PR) 曲线。 B 脓毒症概率的平均变化,Δ​P​(脓毒症)\Delta P(\mathrm{脓毒症}),作为验证数据集中脓毒症阳性序列中首次温度测量的反事实生命体征箱(平均值±\pm SEM)的函数,按年龄分层(24-59岁与71-87岁)。 C 示例验证案例显示了预测的脓毒症概率(黑色)和未来 6 小时内的预测最大 HR,其中最大 HR 用虚线(浅蓝色)绘制。红色虚线标记 6 小时至脓毒症时间点。报告的脓毒症风险和预测的最大 HR 均以窗口为 5 的滚动平均值绘制。 D 脓毒症风险最大 1 小时增加的每个token归因,在 C 中以红色标记。